NVIDIA Cosmos Reason 2 2B
NVIDIA · USA · 2025
Model wizyjno-językowy 2B, który ogląda wideo i rozumuje o fizyce, przestrzeni i czasie — planująca połowa stosu Cosmos NVIDII, dotrenowana z modelu Qwen3-VL-2B-Instruct Alibaby.
NVIDIA Cosmos Reason 2 2B to warstwa rozumująca stosu Cosmos dla fizycznej AI — i warto tu być precyzyjnym, bo nazwa Cosmos obejmuje dziś dwa różne rodzaje modeli. Cosmos 3 Super, Nano i Edge to modele świata: przyjmują ruch i przewidują, jak scena będzie po nim wyglądać. Cosmos Reason nie generuje nic wizualnego. Ogląda wideo i pisze o nim tekstem: co się dzieje, w jakiej kolejności, czy jest to fizycznie możliwe i co ucieleśniony agent powinien zrobić dalej. Punkt kontrolny liczy 2 438 696 960 parametrów. NVIDIA opublikowała ten punkt kontrolny 19 grudnia 2025 r., razem z poziomem 8 mld, a 10 marca 2026 r. wymieniła wagi na nowsze — według producenta z lepszymi wynikami w testach i mniejszą skłonnością do zmyślania. Poziom 32 mld doszedł 29 kwietnia 2026 r. Architektura nie jest własnością NVIDII. Cosmos Reason 2 2B powstał przez dotrenowanie modelu Qwen3-VL-2B-Instruct, otwartego modelu wizyjno-językowego Alibaby, i zachowuje jego architekturę bez zmian — transformer wizyjny podający dane do gęstego transformera językowego. Wkładem NVIDII jest dotrenowanie, a tabela wyników w karcie modelu uczciwie pokazuje, co ono daje. Wobec modelu bazowego, z którego powstał, ogólne wyniki wizyjne prawie nie drgnęły: 62.21 wobec 59.60 łącznie. Na pytaniach robotycznych różnica jest większa: 45.52 wobec 42.07. Ale na dziedzinach, na których NVIDII zależy handlowo, różnica jest zupełnie innego rzędu: 57.37 wobec 42.73 w testach jazdy autonomicznej i 64.14 wobec 36.63 w rozumieniu przestrzeni magazynowej. Dotrenowanie nie robi tu modelu mądrzejszego — robi model, który zna konkretny świat. W praktyce model czyta tekst plus wideo (MP4) albo obrazy (JPG), a zwraca wyłącznie tekst. Okno kontekstu ma 256 000 tokenów i to ono umożliwia analizę długich nagrań; NVIDIA zaleca podawać wideo w tempie 4 klatek na sekundę, tak jak w treningu, i rezerwować co najmniej 4096 tokenów na odpowiedź, bo model jest uczony rozpisywać rozumowanie na widoku, zanim odpowie. Poza opisaniem sceny potrafi wskazywać: lokalizację punktów w 2D i 3D oraz ramki obiektów, każdą z tekstowym wyjaśnieniem, dlaczego wskazał akurat ten obiekt. NVIDIA wymienia trzy zastosowania. Agenci do analityki wideo, którzy przeszukują i streszczają nagrania albo obraz na żywo. Porządkowanie danych, gdzie model filtruje i opisuje dane z czujników używane do uczenia innych modeli fizycznej AI. Oraz planowanie dla robota, gdzie siedzi nad modelem wizyjno-językowo-czynnościowym jako wolniejsza, rozważna połowa mózgu — czyta złożone polecenie, rozbija je na kroki i przekazuje w dół. Licencja jest liberalna, ale z jednym ostrym zapisem. NVIDIA Open Model License dopuszcza użycie komercyjne, tworzenie modeli pochodnych i swobodne korzystanie z wyników — lecz umowa wygasa automatycznie, jeśli wyłączysz albo osłabisz zabezpieczenia modelu, nie stawiając w ich miejsce porównywalnych. Wagi leżą na Hugging Face za automatyczną bramką licencyjną: akceptujesz warunki i pobieranie rusza, bez oceny człowieka. Mierzone użyciem, a nie rozmiarem, jest to najpopularniejszy model NVIDII w całej linii Cosmos: 969 959 pobrań z Hugging Face w 30 dniach do 26 sierpnia 2026 r., wobec około 121 tysięcy dla flagowego Cosmos 3 Super o 64 mld parametrów. To małego rozumującego naprawdę się uruchamia.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!