MDL-3959EST.2025 · IDX.268
AI dla robotykiW produkcji

NVIDIA Cosmos Predict 2.5 14B

NVIDIA · USA · 2025

Poziom 14 mld parametrów warstwy przewidującej Cosmos NVIDII: to samo pięciosekundowe generowanie świata w 720p co w modelu 2 mld, przy siedmiokrotnie większej liczbie parametrów i bez wyspecjalizowanych odmian robotycznych.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

NVIDIA Cosmos Predict 2.5 14B to duży poziom warstwy przewidującej stosu Cosmos — tej części, która wyobraża sobie, co stanie się dalej. Z opisu tekstowego, pierwszej klatki albo krótkiego urywka generuje pięć sekund obrazu 720p w tempie 16 klatek na sekundę, przeznaczonego nie do oglądania, lecz jako syntetyczny materiał do uczenia i świat, w którym roboty i oprogramowanie do jazdy autonomicznej mogą ćwiczyć. Punkt kontrolny liczy 14 368 048 004 parametry — siedem razy więcej niż poziom 2 mld — i ma tę samą konstrukcję: transformer dyfuzyjny odszumiający wideo w przestrzeni utajonej, z uwagą skrośną niosącą polecenie tekstowe przez cały proces i z klatkami warunkującymi doklejanymi wzdłuż osi czasu. NVIDIA podaje, że model powstał z Cosmos-Predict2-14B-Video2World, odpowiadającego punktu kontrolnego poprzedniej generacji. Wyszedł 4 grudnia 2025 r., dwa miesiące po poziomie 2 mld. Różnica między poziomami to nie tylko rozmiar. Punkt kontrolny 2 mld ma całą półkę dotrenowanych odmian — motoryzacyjną z siedmiu kamer, robotyczne wielowidokowe, w tym jedną uczoną na danych AgiBota, sterowaną czynnością oraz sterującą, zwracającą czynności robota. Punkt kontrolny 14 mld występuje wyłącznie w dwóch postaciach: przed dotrenowaniem i po nim. W dużym modelu mieszka jakość obrazu; wyspecjalizowana, wdrożeniowa robota dzieje się poziom niżej. Liczby pobrań mówią to samo dosadniej. W 30 dniach do 26 sierpnia 2026 r. model 14 mld pobrano 1971 razy, model 2 mld — 10 247 razy, a Cosmos Predict 2 2B Video2World z poprzedniej generacji — 229 143 razy. Modele świata są drogie w uruchomieniu, a branża głosuje swoimi kartami graficznymi. Ograniczenia podane przez NVIDIĘ obowiązują i tutaj: artefakty w długim wideo w wysokiej rozdzielczości, niespójność w czasie, niestabilny ruch kamery i obiektów, obiekty znikające albo przeobrażające się oraz ruch fizycznie niemożliwy. Firma testowała wnioskowanie na układach H100, A100 i B200, wspiera mikroarchitektury Ampere, Hopper i Blackwell, a sprawdziła wyłącznie precyzję BF16 i wyłącznie system Linux. Licencja to standardowy układ Cosmosa: NVIDIA Open Model License dopuszcza użycie komercyjne i modele pochodne i nie rości sobie praw do wygenerowanych wyników, ale wygasa automatycznie, jeśli ktoś obejdzie albo osłabi zabezpieczenia modelu, nie stawiając w ich miejsce równoważnych. W odróżnieniu od punktu 2 mld wagi 14 mld nie stoją za bramką licencyjną — kartę modelu i pliki można czytać i pobierać wprost.

#world model#physical AI#open weights#video generation#simulation
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję