Pelican-VLA 0.5
Beijing Innovation Center of Humanoid Robotics (X-Humanoid) · Chiny · 2026
Model działania o otwartych wagach z pekińskiego centrum humanoidów: polityka 5 mld parametrów, w której obraz i polecenie docierają do ruchu przez 32 tokeny wąskiego gardła.
Pelican-VLA 0.5 to pierwszy model działania (vision-language-action) opublikowany przez pekińskie Centrum Innowacji Robotyki Humanoidalnej — tę samą państwową jednostkę, która buduje humanoidy Tiangong i modele percepcji Pelican-VL. O ile Pelican-VL opisuje scenę, ten model wydaje ruch robota. Sednem konstrukcji jest celowe ograniczenie. Między percepcją a działaniem sieć umieszcza 32 uczone tokeny wąskiego gardła, a maska uwagi zabrania ścieżce działania sięgać wprost do gęstych tokenów obrazu. Wszystko, na czym opiera się ruch, musi przejść przez ten interfejs o stałej pojemności. Centrum podaje, że samo to ograniczenie wystarcza, by uwaga skupiła się na przedmiocie wskazanym w poleceniu i na miejscu chwytu — bez masek segmentacji, adnotacji obiektów i nadzoru nad uwagą, jeszcze przed dostrajaniem do konkretnego zadania. Polityka działa na jednym rdzeniu Qwen3-VL 4B (łącznie około 5 miliardów parametrów), z głowicą ruchu opartą na dopasowaniu przepływu, która wydaje paczki po 50 akcji w dziesięciu krokach odszumiania, oraz z zamrożonym tokenizatorem NVIDIA Cosmos odpowiadającym za historię obrazu i przewidywanie przyszłych klatek. Wstępne uczenie objęło około 2400 godzin nagrań manipulacji z różnych konstrukcji robotów. W teście RoboTwin 2.0, po dostrojeniu, centrum raportuje 91,2% średniej skuteczności — najlepszy wynik w swoim zestawieniu modeli o otwartych wagach, przed Hy-VLA (90,5) i JoyAI-RA (89,9) — przy różnicy zaledwie 0,4 punktu między warunkami czystymi a losowo zaburzonymi. Raport nietypowo szczerze mówi o brakach: autorzy nazywają model etapem pośrednim i wskazują lukę między rozpoznaniem a działaniem, czyli że maszyna zaczyna rozpoznawać, na czym ma działać, zanim nauczy się działać niezawodnie. Karta modelu wprost zaznacza, że to punkt kontrolny badawczy, a nie sterownik produkcyjny. Wagi są na licencji Apache 2.0, ale do uruchomienia potrzeba jeszcze dwóch pobrań na odrębnych licencjach: rdzenia Qwen3-VL i tokenizatora Cosmos od NVIDII.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!