WoW-1 (Wu 1.0)
Beijing Innovation Center of Humanoid Robotics (X-Humanoid) · China · 2025
Model świata, który nauczył się fizyki z dwóch milionów prawdziwych prób robotów, a nie z filmów z internetu, i przekazuje to, co sobie wyobrazi, drugiemu modelowi zamieniającemu obraz w ruch robota.
WoW-1 — od World-Omniscient World model, a w materiałach producenta Wu 1.0 (天悟) — to model świata o otwartych wagach z Pekińskiego Centrum Innowacji Robotyki Humanoidalnej (X-Humanoid), państwowej jednostki stojącej za humanoidami Tiangong. Pierwsze punkty kontrolne pojawiły się 15 października 2025 roku, a mała wersja o 1,3 miliarda parametrów doszła 28 października. Model świata przewiduje, jak scena będzie wyglądać po wykonaniu czynności — dzięki temu robot może przećwiczyć ruch, zanim go wykona. Założenie WoW jest krytyką sposobu, w jaki zwykle buduje się modele wideo: systemy pokroju Sory uczą się z biernej obserwacji filmów, a autorzy twierdzą, że fizycznej przyczynowości tak się nie przyswoi. Główną wersję o 14 miliardach parametrów wytrenowano więc na 2 milionach prawdziwych trajektorii interakcji robotów, czyli nagraniach maszyn, które naprawdę popychały, chwytały i upuszczały przedmioty. Centrum podaje skład wstępnego uczenia jako 15 procent nagrań robotów i 85 procent własnego zbioru RoboMIND, a sam model opiera się na generatorze wideo Wan od Alibaby. Najuczciwszą częścią raportu jest opisana w nim wada. Rozumienie fizyki przez model okazuje się rozkładem prawdopodobieństwa możliwych wyników, co w praktyce oznacza niestabilność i to, co autorzy nazywają halucynacją fizyczną — przedmioty zachowują się tak, jak zachować się nie mogą. Powstrzymać to mają dwa dodatki. SOPHIA to krytyk wizyjno-językowy, który ocenia wygenerowane wideo i przepisuje polecenie, aż wynik wygląda fizycznie sensownie. Trenowany równolegle model dynamiki odwrotnej zamienia następnie przyjęty film na wykonalne czynności robota, domykając drogę od wyobrażenia do ruchu. Zespół opublikował też WoWBench, własny test spójności fizycznej i rozumowania przyczynowego w wideo, i podaje na nim najlepsze wyniki zarówno w ocenie ludzi, jak i automatycznej — z zastrzeżeniem, że test i model pochodzą od tych samych autorów. Wagi są na Hugging Face na licencji MIT w kilku wielkościach: 14B uczone na pełnych 2 milionach trajektorii, 14B na 600 tysiącach, wersje DiT o 2 i 7 miliardach parametrów oraz 1,3B na słabszy sprzęt. Nie każde repozytorium w tym zestawie ma plik licencji, więc przy ponownym użyciu mniejszych wersji DiT warto sprawdzić warunki przed wdrożeniem.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!