Wszystkie newsyBadania

Mózg dla robotów od NVIDII wygrywa własną tabelę porównawczą o trzydzieści punktów w jednej kategorii. Ta kategoria to jeden test, który wydaje sama NVIDIA

Opublikowano: 13.09.2026 · Źródło: NVIDIA — Cosmos-Reason2 model card, Hugging Face

NVIDIA zestawia wszystkie trzy wielkości modelu Cosmos Reason 2 z modelem Alibaby, z którego każda z nich powstała przez dotrenowanie. W trzech z czterech dziedzin przewaga jest jednocyfrowa. W czwartej, przestrzeniach inteligentnych, jest ogromna: 77,79 wobec 47,55 dla wersji 32 mld, 69,96 wobec 42,66 dla 8 mld i 64,14 wobec 36,63 dla 2 mld. Wystarczy zejść wzrokiem o wiersz niżej, żeby zobaczyć przyczynę. Ta dziedzina nie składa się z kilku testów. To jeden test, Warehouse AI, a zbiór danych, na którym stoi, leży na firmowym koncie NVIDII na Hugging Face. Ten sam układ powtarza się ciszej w robotyce. Przewaga jest tam prawdziwa, ale skromna, i bierze się niemal w całości z dwóch zestawów noszących nazwę własnej rodziny modeli: CR Common i CR Embodied, gdzie każda wielkość bije swój model bazowy. Na dwóch testach akademickich z tego samego bloku obraz się zmienia. W ERQA wersje 8 mld i 2 mld mają dokładnie tyle samo punktów co ich modele bazowe, co do setnej, a wersja 32 mld wypada niżej od swojej bazy: 45,25 wobec 46,50. W Where2Place wersja 8 mld dostaje 50,00 wobec 53,00 dla modelu, z którego powstała. Nic z tego nie jest ukryte. Wszystkie powyższe liczby pochodzą z opublikowanej tabeli NVIDII, źródło każdego zbioru testowego jest podlinkowane na tej samej stronie, a firmie należy się uznanie za to, że drukuje także wiersze, w których jej model przegrywa. To jednak dobra lekcja, czego tabela porównawcza producenta czytelnikowi nie powie. Kategoria zbudowana z jednego zbioru danych jest pojedynczym pomiarem, a nie dziedziną, a kiedy pomiar i model pochodzą z tego samego domu, przewaga mówi tyle samo o doborze testu, co o samym modelu. Nasze trzy profile Cosmos Reason 2 podają te liczby i dziś sprawdziliśmy każdą z nich względem kolumny, do której należy. To część audytu wszystkich profili w katalogu, w których polu wyników pojawia się nazwa konkurencyjnego modelu.