Pelican1.0-VL-72B
Beijing Innovation Center of Humanoid Robotics (X-Humanoid) · China · 2025
Model wizyjno-językowy o 73 miliardach parametrów pomyślany jako mózg robota, a nie czatbot: czyta scenę, ustala, co trzeba przestawić najpierw, i wypisuje kolejne czynności.
Pelican1.0-VL-72B to flagowy model rodziny Pelican-VL 1.0 — zestawu modeli o otwartych wagach, pomyślanych jako mózg robota, wydanych przez Pekińskie Centrum Innowacji Robotyki Humanoidalnej, czyli tę samą państwową jednostkę, która buduje humanoidy Tiangong i występuje za granicą pod nazwą X-Humanoid. Wersje 7B i 72B trafiły do sieci 13 listopada 2025 roku, 3B doszła 1 grudnia 2025, a licząca 235 miliardów parametrów wersja z mieszaniną ekspertów i obsługą wywoływania narzędzi — 7 lutego 2026. Wszystkie na licencji Apache 2.0. To nie jest ogólny asystent. Model przyjmuje obraz i wideo razem z tekstem i odpowiada na pytania, na które robot musi odpowiedzieć, zanim się poruszy: gdzie w przestrzeni leży przedmiot, co zasłania co, jak wygląda sensowny punkt chwytu i w jakiej kolejności wykonać wieloetapowe zadanie. Wersja 72B ma 73,41 miliarda parametrów w formacie bfloat16, opiera się na architekturze Qwen2.5-VL i przyjmuje kontekst 128 000 tokenów, więc długa sekwencja wideo mieści się w jednym przebiegu. Sposób trenowania autorzy przedstawiają jako główny wkład. Nazwali go DPPO, od optymalizacji polityki przez świadomą praktykę: zamiast jednego dostrajania model przechodzi pętlę uczenia ze wzmocnieniem, poprawiania, diagnozy i nadzorowanego dostrajania, w której każdy obieg tworzy nowe trudne przykłady wymierzone w to, co model właśnie pomylił. Surowy zbiór danych przed destylacją liczył ponad 4 miliardy tokenów, a podany koszt to klaster ponad tysiąca układów A800 i ponad 50 000 godzin pracy A800 na każdy punkt kontrolny. Główne wyniki pochodzą z raportu zespołu i nie zostały niezależnie powtórzone: poprawa o 20,3 procent względem modelu bazowego i o 10,6 procent względem otwartych modeli klasy 100 miliardów parametrów w uznanych testach ucieleśnionej inteligencji. Przyjęte wprost stawiałyby model na równi z systemami zamkniętymi w tej wąskiej klasie zadań. Praktyczne zastrzeżenie dotyczy odbioru. Mimo licencji Apache 2.0 i rekordu wielkości, o którym mówi rodzina — największy otwarty wielomodalny model mózgu ucieleśnionego w dniu wydania — oficjalne punkty kontrolne notują na Hugging Face zaledwie dziesiątki pobrań miesięcznie, a skwantowane przeróbki tych samych wag przyciągają większy ruch niż oryginały.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!