NVIDIA Cosmos Predict 2.5 2B
NVIDIA · USA · 2025
Dyfuzyjny model świata o 2 mld parametrów, który z opisu, zdjęcia albo urywka wideo robi pięć sekund fizycznie sensownego obrazu 720p — mały, chętnie używany poziom warstwy przewidującej Cosmos NVIDII.
NVIDIA Cosmos Predict 2.5 2B to warstwa przewidująca stosu Cosmos dla fizycznej AI i mniejszy z jej dwóch poziomów. Podczas gdy Cosmos Reason ogląda wideo i pisze o nim tekstem, Predict robi rzecz odwrotną: dostaje opis, pierwszą klatkę albo krótki urywek i generuje to, co stanie się dalej — pięć sekund obrazu 720p w tempie 16 klatek na sekundę. Nie chodzi o rozrywkę. Wygenerowane wideo jest materiałem do uczenia i poligonem dla robotów oraz samochodów autonomicznych: światami, w których maszyna może ćwiczyć, choć nikt ich nie zbudował. Punkt kontrolny liczy 2 059 174 912 parametrów. To transformer dyfuzyjny odszumiający wideo w przestrzeni utajonej; warstwy uwagi skrośnej pozwalają opisowi tekstowemu sterować całym odszumianiem, a gdy podać obraz albo wideo, jego utajone klatki doklejane są do klatek generowanych. NVIDIA wprost podaje, że model powstał z Cosmos-Predict2-2B-Video2World, czyli punktu kontrolnego poprzedniej generacji. Najbardziej praktyczna zmiana tego pokolenia to scalenie. W Cosmos Predict 2 tekst-na-obraz, tekst-na-świat i wideo-na-świat mieszkały w osobnych repozytoriach i osobnych plikach. Predict 2.5 mieści pod jednym dachem model bazowy i jego dotrenowane odmiany: wersję przed dotrenowaniem i po nim; odmianę motoryzacyjną, która przewiduje tę samą scenę z siedmiu kamer pojazdu; dwie odmiany robotyczne wielowidokowe, w tym jedną dotrenowaną specjalnie na danych AgiBota; odmianę sterowaną czynnością, która przyjmuje sekwencję ruchów robota jako warunek i odpowiada w 256p przy 4 kl./s; oraz odmianę sterującą dotrenowaną na zbiorach LIBERO i RoboCasa, zwracającą nie obrazki, tylko czynności robota i jego przyszłe położenie. NVIDIA otwarcie pisze o ograniczeniach. Modele mają kłopot z długim wideo w wysokiej rozdzielczości bez artefaktów; karta wymienia niespójność w czasie, niestabilny ruch kamery i obiektów oraz nieprecyzyjne interakcje, a także obiekty, które znikają albo się przeobrażają, i ruchy fizycznie niemożliwe. Zastosowania wymagające rzetelnej fizyki albo złożonej gry wielu podmiotów pozostają trudne. Wagi pobiera się bezpłatnie na licencji NVIDIA Open Model License: użycie komercyjne dozwolone, modele pochodne dozwolone, NVIDIA nie rości sobie praw do wyników — z typowym dla Cosmosa ostrzem, że licencja wygasa automatycznie po wyłączeniu zabezpieczeń modelu bez równoważnego zamiennika. Pobieranie chroni automatyczna bramka licencyjna na Hugging Face. Jedna liczba ustawia to pokolenie w perspektywie. W 30 dniach do 26 sierpnia 2026 r. ten punkt kontrolny pobrano 10 247 razy, a model, który miał zastąpić — Cosmos Predict 2 2B Video2World — pobrano 229 143 razy. Prawie rok po premierze nowszy model świata wciąż jest tym rzadziej używanym.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!