MDL-5344EST.2026 · IDX.636
AI dla robotykiW produkcji

NVIDIA Cosmos Reason 2 32B

NVIDIA · USA · 2026

Model wizyjno-językowy 32B, który ogląda wideo i rozumuje o fizyce, przestrzeni i czasie — planująca połowa stosu Cosmos NVIDII, dotrenowana z modelu Qwen3-VL-32B-Instruct Alibaby.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

NVIDIA Cosmos Reason 2 32B to warstwa rozumująca stosu Cosmos dla fizycznej AI — i warto tu być precyzyjnym, bo nazwa Cosmos obejmuje dziś dwa różne rodzaje modeli. Cosmos 3 Super, Nano i Edge to modele świata: przyjmują ruch i przewidują, jak scena będzie po nim wyglądać. Cosmos Reason nie generuje nic wizualnego. Ogląda wideo i pisze o nim tekstem: co się dzieje, w jakiej kolejności, czy jest to fizycznie możliwe i co ucieleśniony agent powinien zrobić dalej. NVIDIA reklamuje model jako 32 mld parametrów; opublikowany punkt kontrolny ma ich w rzeczywistości 33 357 390 064. Poziom 32 mld wyszedł później niż reszta rodziny: modele 2 mld i 8 mld NVIDIA opublikowała 19 grudnia 2025 r., a ten punkt kontrolny dołożyła 29 kwietnia 2026 r. Architektura nie jest własnością NVIDII. Cosmos Reason 2 32B powstał przez dotrenowanie modelu Qwen3-VL-32B-Instruct, otwartego modelu wizyjno-językowego Alibaby, i zachowuje jego architekturę bez zmian — transformer wizyjny podający dane do gęstego transformera językowego. Wkładem NVIDII jest dotrenowanie, a tabela wyników w karcie modelu uczciwie pokazuje, co ono daje. Wobec modelu bazowego, z którego powstał, ogólne wyniki wizyjne prawie nie drgnęły: 75.85 wobec 73.07 łącznie. Na pytaniach robotycznych różnica jest większa: 60.60 wobec 55.06. Ale na dziedzinach, na których NVIDII zależy handlowo, różnica jest zupełnie innego rzędu: 70.15 wobec 48.08 w testach jazdy autonomicznej i 77.79 wobec 47.55 w rozumieniu przestrzeni magazynowej. Dotrenowanie nie robi tu modelu mądrzejszego — robi model, który zna konkretny świat. W praktyce model czyta tekst plus wideo (MP4) albo obrazy (JPG), a zwraca wyłącznie tekst. Okno kontekstu ma 256 000 tokenów i to ono umożliwia analizę długich nagrań; NVIDIA zaleca podawać wideo w tempie 4 klatek na sekundę, tak jak w treningu, i rezerwować co najmniej 4096 tokenów na odpowiedź, bo model jest uczony rozpisywać rozumowanie na widoku, zanim odpowie. Poza opisaniem sceny potrafi wskazywać: lokalizację punktów w 2D i 3D oraz ramki obiektów, każdą z tekstowym wyjaśnieniem, dlaczego wskazał akurat ten obiekt. NVIDIA wymienia trzy zastosowania. Agenci do analityki wideo, którzy przeszukują i streszczają nagrania albo obraz na żywo. Porządkowanie danych, gdzie model filtruje i opisuje dane z czujników używane do uczenia innych modeli fizycznej AI. Oraz planowanie dla robota, gdzie siedzi nad modelem wizyjno-językowo-czynnościowym jako wolniejsza, rozważna połowa mózgu — czyta złożone polecenie, rozbija je na kroki i przekazuje w dół. Licencja jest liberalna, ale z jednym ostrym zapisem. NVIDIA Open Model License dopuszcza użycie komercyjne, tworzenie modeli pochodnych i swobodne korzystanie z wyników — lecz umowa wygasa automatycznie, jeśli wyłączysz albo osłabisz zabezpieczenia modelu, nie stawiając w ich miejsce porównywalnych. W odróżnieniu od poziomów 2 mld i 8 mld ten punkt kontrolny nie ma na Hugging Face bramki licencyjnej — pliki pobierają się bez akceptowania czegokolwiek. Pobrań ma niewiele — 3194 w 30 dniach do 26 sierpnia 2026 r., wobec prawie miliona dla poziomu 2 mld. Praca nad fizyczną AI dzieje się na małym końcu tej rodziny, nie na flagowcu.

#reasoning VLM#physical AI#open weights#video understanding#robot planning
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję