MDL-8392EST.2026 · IDX.057
AI dla robotykiW produkcji

NVIDIA Cosmos 3 Super

NVIDIA · USA · 2026

Model świata o 64 mld parametrów, który przyjmuje na wejściu trajektorię ruchu robota, a zwraca wideo, dźwięk i kolejne czynności — ta sama sieć wyobraża sobie scenę i nią steruje.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

NVIDIA Cosmos 3 Super to flagowiec trzeciej generacji modeli świata NVIDII — modeli budowanych nie po to, by odpowiadać na pytania, lecz by przewidywać, co za chwilę stanie się w fizycznej scenie. Wagi opublikowano na Hugging Face 31 maja 2026 r. na licencji OpenMDW 1.1, która dopuszcza użycie komercyjne; samą rodzinę zapowiedziano dwa i pół miesiąca wcześniej, w marcu 2026 r., razem z programem partnerskim NVIDII dla robotyki. Od generatora wideo Cosmos 3 odróżnia kanał czynności. Obok tekstu, obrazu, wideo i dźwięku model przyjmuje trajektorię ruchu — ciąg pozycji stawów, stanu chwytaka albo pozy kamery, klatka po klatce — i taką samą trajektorię potrafi zwrócić. Daje to dwie operacje, których naprawdę potrzebuje zespół robotyczny: dynamikę przednią (oto scena, oto ruch, który zamierzam wykonać — pokaż, co się stanie) i dynamikę odwrotną (oto dwie klatki, powiedz, jaki ruch je wywołał). Ten sam punkt kontrolny robi jedno i drugie, bo w obu przypadkach chodzi tylko o to, co wchodzi i co wychodzi. Architektura to Mixture-of-Transformers, czyli dwie wieże. Transformer autoregresyjny generuje tokeny dyskretne, więc tekst powstaje zwykłym dekodowaniem kolejnego tokenu. Transformer dyfuzyjny obsługuje wszystko, co ciągłe — obraz, wideo, dźwięk i czynności — przez iteracyjne odszumianie. NVIDIA argumentuje, że dzięki temu każda modalność zostaje przy mechanizmie generacji, który do niej pasuje, zamiast być przepychana przez jeden wspólny. Deklarowana liczba parametrów to 64 mld; punkt kontrolny na Hugging Face ma dokładnie 64 615 003 632 parametry w BF16. Obsługa czynności nie jest uniwersalna — jest wypisana osobno dla każdego ucieleśnienia, z ustaloną liczbą wymiarów: pojedyncze ramię Franka Panda z chwytakiem RobotiQ to 10D, układ dwuramienny 20D, AgiBot 29D, ruch egocentryczny człowieka 57D, pojazd autonomiczny 9D. Robota spoza tej listy nie da się po prostu podpiąć. Dwa ograniczenia warto poznać, zanim potraktuje się to jak ogólny model wideo. Wejście dźwiękowe jest ucięte na pół sekundy. Wejście wideo — na pięć klatek: modelowi pokazuje się sytuację, nie film. Na wyjściu jest odwrotnie: od 5 do 400 klatek, domyślnie 189, w rozdzielczości 256p, 480p albo 720p. Część rozumująca jest bardziej konwencjonalna — okno kontekstu ma 256 000 tokenów, a wideo zaleca się podawać w 4 klatkach na sekundę. Zbiór treningowy tłumaczy rachunek za obliczenia. NVIDIA podaje 767 mln próbek obrazu i 348 mln próbek wideo po stronie generacyjnej oraz 22 mln tekstowych, 19 mln obrazowych i 1 mln wideo po stronie rozumowania, zbieranych mieszanie: z czujników, syntetycznie i automatycznie. Rodzina jest celowo podzielona na poziomy, a nie na wersje: Cosmos3-Nano o 16 mld i Super o 64 mld parametrów wyszły razem 31 maja 2026 r., a 20 lipca 2026 r. dołączyły Cosmos3-Edge o 4 mld parametrów oraz czterokrokowe warianty destylowane generatorów obrazu i wideo. Starsze pokolenia Cosmos — Predict, Transfer i Reason — pozostają dostępne i nie zostały wycofane.

#world foundation model#open weights#physical AI#omnimodal#synthetic training data
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję