Tencent Hy-Embodied-0.5-VLA-UMI
Tencent · China · 2026
Model Tencenta, który nie opisuje sceny, tylko wydaje ruchy dwóch ramion robota. Uczony na 10 tysiącach godzin nagrań ludzkich rąk, wydany razem z piątą częścią tych nagrań.
Hy-Embodied-0.5-VLA-UMI to miejsce, w którym robotyczne oprogramowanie Tencenta zamienia myśl w ruch. Model leżący pod spodem, HY-Embodied-0.5, ogląda scenę i rozstrzyga, co ma się stać. Ten bierze tę decyzję i wydaje już konkretną trajektorię dwóch ramion robota: położenie, obrót i rozwarcie chwytaka, pięćdziesiąt kroków naprzód, dziesięć razy na sekundę. Opublikowany plik ma około 4,5 mld parametrów. Blisko 3,8 mld z tego to pożyczony rdzeń wizja-język; naprawdę nowy jest tu 370-milionowy, dwuwieżowy transformer dopasowania przepływu, nazwany przez producenta ekspertem od czynności. Dopasowanie przepływu znaczy tyle, że model nie wybiera następnego ruchu z listy wariantów, tylko kształtuje ciągłą trajektorię — a tego właśnie potrzebuje fizyczne ramię. Czynności zapisano jako zmianę względem pierwszej klatki, nie jako kąty w przegubach, więc tę samą strategię da się przenieść na robota zbudowanego inaczej; producent podaje, że sprawdził to na czterech rzeczywistych maszynach. Nietypowe w tym wydaniu są dane. Większość modeli robotycznych wychodzi jako same wagi, a nagrania, które je zrodziły, zostają w firmie, bo to ich zebranie kosztuje najwięcej. Tencent uczył ten model na ponad 10 tysiącach godzin dwuręcznych demonstracji, nagranych własną nakładką na palce i optycznym systemem śledzenia ruchu, po czym opublikował z tego 2163 godziny: 250 304 epizody, 233 mln klatek, 18,8 TB, na licencji CC BY 4.0. To mniej więcej piąta część korpusu treningowego i o piątą część więcej, niż branża zwykle pokazuje. Ten model jest świadomie niedokończony. To punkt wyjścia dla wszystkich zastosowań naraz: 200 tysięcy kroków uczenia na 64 kartach graficznych, jedna klatka obrazu, bez pamięci wcześniejszych — do dostrojenia pod konkretnego robota. Wersję dostrojoną pod test wydano osobno, jako Hy-Embodied-0.5-VLA-RoboTwin. Jeden szczegół jest ważny dla czytelnika z Polski. Rdzeń wizja-język, na którym ten model stoi, wydano na licencji Tencenta, która wyraźnie nie obowiązuje w Unii Europejskiej, Wielkiej Brytanii i Korei Południowej. Ten model — nie: idzie na czystej Apache 2.0, tak samo jak opublikowany zbiór nagrań. Dwa pliki, dwie różne sytuacje prawne, w jednej rodzinie. Raport techniczny: arXiv 2606.14409.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!