MDL-2796EST.2025 · IDX.770
AI dla robotykiW produkcji

NVIDIA Cosmos Transfer 2.5 2B

NVIDIA · USA · 2025

Model sterowany o 2 mld parametrów, który przemalowuje symulację: podajesz mapę głębi, maskę segmentacji, mapę krawędzi albo rozmyty urywek, a dostajesz fotorealistyczne wideo 720p o tej samej geometrii — most NVIDII z symulatora do danych treningowych.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

NVIDIA Cosmos Transfer 2.5 2B to trzecia warstwa stosu Cosmos i ta o najbardziej jednoznacznym zadaniu. Cosmos Predict wyobraża sobie, co stanie się dalej; Cosmos Reason ogląda wideo i je objaśnia. Transfer nie robi ani jednego, ani drugiego — bierze wideo, którego geometria jest już przesądzona, i przemalowuje je na fotorealizm. Podajesz mapę głębi, maskę segmentacji, mapę krawędzi albo rozmyty urywek, plus opis wyglądu, jakiego oczekujesz, a dostajesz wideo 720p w tempie 16 klatek na sekundę: te same kształty w tych samych miejscach, ale wyglądające jak nagranie z kamery. To problem przenoszenia z symulacji do rzeczywistości postawiony jako produkt. Zespół robotyczny może zbudować scenę w symulatorze, gdzie położenie każdego obiektu jest znane, a każda etykieta darmowa, po czym oddać geometrię Transferowi i poprosić o tę samą scenę o zmierzchu, w deszczu, w innym magazynie, na innej posadzce. Wynik zachowuje opisy, dzięki którym dane nadają się do uczenia, i gubi plastikowy wygląd, przez który nagranie z symulatora jest kiepskim zamiennikiem rzeczywistości. Punkt kontrolny liczy 2 358 047 744 parametry. Architektonicznie to model bazowy Cosmos Predict 2.5 z doczepionymi gałęziami sterującymi: kilka bloków transformera jest powielonych, żeby przetworzyć każde wideo sterujące, wyciągnąć z niego sygnał i wstrzyknąć go z powrotem do odpowiadających bloków sieci bazowej. Naraz można podać do czterech wejść sterujących — muszą pochodzić z tego samego nagrania źródłowego i mieć identyczne wymiary przestrzenne i czasowe — a łączone są mapami wag w przestrzeni i czasie, co pozwala jednej części kadru iść za mapą głębi, a innej za maską segmentacji. NVIDIA podaje, że model powstał z Cosmos-Predict2.5. Sterowanie krawędziami i rozmyciem można wyliczyć automatycznie, gdy poda się samo wideo RGB. Druga odmiana służy jeździe autonomicznej: z siedmiu wideo sterujących z zestawu kamer pojazdu — przód środek, przód lewo, przód prawo, tył lewo, tył prawo, tył teleobiektyw i przód teleobiektyw — generuje po 29 spójnych widokowo klatek dla każdej z siedmiu kamer w rozdzielczości 1280x720. Ta odmiana była uczona na wideo 720p przy 10 kl./s. Koszt nie jest ukrywany. NVIDIA podaje, że model potrzebuje 65,4 GB pamięci karty graficznej, i publikuje czasy generowania jednego urywka sterowanego segmentacją: 285,83 s na B200, 719,4 s na H100 NVL, 870,3 s na H100 PCIe i 2326,6 s — prawie 39 minut — na H20, okrojonej karcie Hopper sprzedawanej na rynek chiński. Dane syntetyczne w tej jakości kupuje się godzinami pracy kart graficznych. Licencja to zwyczajowy układ Cosmosa: użycie komercyjne i modele pochodne dozwolone na NVIDIA Open Model License, żadnych roszczeń do wyników, automatyczne wygaśnięcie po wyłączeniu zabezpieczeń bez równoważnego zamiennika. W praktyce jest to drugi najczęściej pobierany model warstw sterującej i przewidującej w katalogu Cosmos: 84 673 pobrania w 30 dniach do 26 sierpnia 2026 r., osiem razy więcej niż model Predict 2.5, na którym stoi.

#world model#physical AI#open weights#sim-to-real#synthetic data
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję