NVIDIA Cosmos Reason 2 8B
NVIDIA · USA · 2025
Model wizyjno-językowy 8B, który ogląda wideo i rozumuje o fizyce, przestrzeni i czasie — planująca połowa stosu Cosmos NVIDII, dotrenowana z modelu Qwen3-VL-8B-Instruct Alibaby.
NVIDIA Cosmos Reason 2 8B to warstwa rozumująca stosu Cosmos dla fizycznej AI — i warto tu być precyzyjnym, bo nazwa Cosmos obejmuje dziś dwa różne rodzaje modeli. Cosmos 3 Super, Nano i Edge to modele świata: przyjmują ruch i przewidują, jak scena będzie po nim wyglądać. Cosmos Reason nie generuje nic wizualnego. Ogląda wideo i pisze o nim tekstem: co się dzieje, w jakiej kolejności, czy jest to fizycznie możliwe i co ucieleśniony agent powinien zrobić dalej. Punkt kontrolny liczy 8 767 123 696 parametrów. NVIDIA opublikowała ten punkt kontrolny 19 grudnia 2025 r., razem z poziomem 2 mld, a 10 marca 2026 r. wymieniła wagi na nowsze — według producenta z lepszymi wynikami w testach i mniejszą skłonnością do zmyślania. Poziom 32 mld doszedł 29 kwietnia 2026 r. Architektura nie jest własnością NVIDII. Cosmos Reason 2 8B powstał przez dotrenowanie modelu Qwen3-VL-8B-Instruct, otwartego modelu wizyjno-językowego Alibaby, i zachowuje jego architekturę bez zmian — transformer wizyjny podający dane do gęstego transformera językowego. Wkładem NVIDII jest dotrenowanie, a tabela wyników w karcie modelu uczciwie pokazuje, co ono daje. Wobec modelu bazowego, z którego powstał, ogólne wyniki wizyjne prawie nie drgnęły: 73.73 wobec 71.98 łącznie. Na pytaniach robotycznych różnica jest większa: 56.90 wobec 53.08. Ale na dziedzinach, na których NVIDII zależy handlowo, różnica jest zupełnie innego rzędu: 67.85 wobec 46.38 w testach jazdy autonomicznej i 69.96 wobec 42.66 w rozumieniu przestrzeni magazynowej. Dotrenowanie nie robi tu modelu mądrzejszego — robi model, który zna konkretny świat. W praktyce model czyta tekst plus wideo (MP4) albo obrazy (JPG), a zwraca wyłącznie tekst. Okno kontekstu ma 256 000 tokenów i to ono umożliwia analizę długich nagrań; NVIDIA zaleca podawać wideo w tempie 4 klatek na sekundę, tak jak w treningu, i rezerwować co najmniej 4096 tokenów na odpowiedź, bo model jest uczony rozpisywać rozumowanie na widoku, zanim odpowie. Poza opisaniem sceny potrafi wskazywać: lokalizację punktów w 2D i 3D oraz ramki obiektów, każdą z tekstowym wyjaśnieniem, dlaczego wskazał akurat ten obiekt. NVIDIA wymienia trzy zastosowania. Agenci do analityki wideo, którzy przeszukują i streszczają nagrania albo obraz na żywo. Porządkowanie danych, gdzie model filtruje i opisuje dane z czujników używane do uczenia innych modeli fizycznej AI. Oraz planowanie dla robota, gdzie siedzi nad modelem wizyjno-językowo-czynnościowym jako wolniejsza, rozważna połowa mózgu — czyta złożone polecenie, rozbija je na kroki i przekazuje w dół. Licencja jest liberalna, ale z jednym ostrym zapisem. NVIDIA Open Model License dopuszcza użycie komercyjne, tworzenie modeli pochodnych i swobodne korzystanie z wyników — lecz umowa wygasa automatycznie, jeśli wyłączysz albo osłabisz zabezpieczenia modelu, nie stawiając w ich miejsce porównywalnych. Wagi leżą na Hugging Face za automatyczną bramką licencyjną: akceptujesz warunki i pobieranie rusza, bez oceny człowieka. Pod względem pobrań jest drugi w linii Cosmos — 640 498 w 30 dniach do 26 sierpnia 2026 r., za poziomem 2 mld i wyraźnie przed znacznie większymi generatorami Cosmos 3.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!