MDL-6170EST.2026 · IDX.562
AI dla robotykiW produkcji

Tencent Hy-Embodied-0.5-VLA-UMI

Tencent · China · 2026

Model Tencenta, który nie opisuje sceny, tylko wydaje ruchy dwóch ramion robota. Uczony na 10 tysiącach godzin nagrań ludzkich rąk, wydany razem z piątą częścią tych nagrań.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Hy-Embodied-0.5-VLA-UMI to miejsce, w którym robotyczne oprogramowanie Tencenta zamienia myśl w ruch. Model leżący pod spodem, HY-Embodied-0.5, ogląda scenę i rozstrzyga, co ma się stać. Ten bierze tę decyzję i wydaje już konkretną trajektorię dwóch ramion robota: położenie, obrót i rozwarcie chwytaka, pięćdziesiąt kroków naprzód, dziesięć razy na sekundę. Opublikowany plik ma około 4,5 mld parametrów. Blisko 3,8 mld z tego to pożyczony rdzeń wizja-język; naprawdę nowy jest tu 370-milionowy, dwuwieżowy transformer dopasowania przepływu, nazwany przez producenta ekspertem od czynności. Dopasowanie przepływu znaczy tyle, że model nie wybiera następnego ruchu z listy wariantów, tylko kształtuje ciągłą trajektorię — a tego właśnie potrzebuje fizyczne ramię. Czynności zapisano jako zmianę względem pierwszej klatki, nie jako kąty w przegubach, więc tę samą strategię da się przenieść na robota zbudowanego inaczej; producent podaje, że sprawdził to na czterech rzeczywistych maszynach. Nietypowe w tym wydaniu są dane. Większość modeli robotycznych wychodzi jako same wagi, a nagrania, które je zrodziły, zostają w firmie, bo to ich zebranie kosztuje najwięcej. Tencent uczył ten model na ponad 10 tysiącach godzin dwuręcznych demonstracji, nagranych własną nakładką na palce i optycznym systemem śledzenia ruchu, po czym opublikował z tego 2163 godziny: 250 304 epizody, 233 mln klatek, 18,8 TB, na licencji CC BY 4.0. To mniej więcej piąta część korpusu treningowego i o piątą część więcej, niż branża zwykle pokazuje. Ten model jest świadomie niedokończony. To punkt wyjścia dla wszystkich zastosowań naraz: 200 tysięcy kroków uczenia na 64 kartach graficznych, jedna klatka obrazu, bez pamięci wcześniejszych — do dostrojenia pod konkretnego robota. Wersję dostrojoną pod test wydano osobno, jako Hy-Embodied-0.5-VLA-RoboTwin. Jeden szczegół jest ważny dla czytelnika z Polski. Rdzeń wizja-język, na którym ten model stoi, wydano na licencji Tencenta, która wyraźnie nie obowiązuje w Unii Europejskiej, Wielkiej Brytanii i Korei Południowej. Ten model — nie: idzie na czystej Apache 2.0, tak samo jak opublikowany zbiór nagrań. Dwa pliki, dwie różne sytuacje prawne, w jednej rodzinie. Raport techniczny: arXiv 2606.14409.

#embodied AI#robotics#vision-language-action#open weights#Apache 2.0#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję