MDL-8790EST.2026 · IDX.014
AI dla robotykiW produkcji

Tencent Hy-Embodied-VLM-1.0

Tencent · China · 2026

Otwarty model wizja-język Tencenta do robotów: trzydzieści miliardów parametrów, z których na każdy token pracują tylko trzy — tyle, by sterować maszyną, która musi odpowiadać na bieżąco.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Hy-Embodied-VLM-1.0 to model, którym robot patrzy na scenę i decyduje, co zrobić dalej. Wagi opublikował zespół Tencent Robotics X 15 lipca 2026 r.; podstawą jest firmowy model językowy Hy3-A3B i koder obrazu Hy-ViT2. Sednem konstrukcji są proporcje. Model ma około 30,5 mld parametrów, ale każdy token przechodzi tylko przez 8 ze 128 ekspertów plus jednego wspólnego — czyli realnie liczy się około 3 mld parametrów. Producent porównuje go z własnym poprzednikiem, który dla zbliżonych wyników uruchamiał 32 mld: mniej więcej dziesiąta część pracujących parametrów przy porównywalnej skuteczności. W robotyce znaczy to więcej niż w rozmowie tekstowej, bo robot, który zawiesi się na sekundę do namysłu, zdążył już upuścić kubek. Zakres zadań jest węższy niż ogólne rozumienie obrazu. Tencent układa go w trzy poziomy: odczyt stanu maszyny i otoczenia, wnioskowanie o tym, co dana czynność zmieni, oraz planowanie wieloetapowe z możliwością zauważenia błędu i naprawienia go. W praktyce chodzi o wskazanie, gdzie leży przedmiot względem innego, ocenę, czy chwyt się udał, ostrzeżenie przed ryzykownym ruchem przed jego wykonaniem i przeplanowanie po nieudanym kroku. Wyniki pochodzą od producenta: pierwsze miejsce w 19 z 38 testów robotycznych i drugie w kolejnych 11, średnio o 4,4 procent przed modelem Qwen3.6-A3B, oraz deklarowany najlepszy rezultat w nawigacji według poleceń słownych R2R-CE przy samym obrazie z kamery. Niezależnego testu tego modelu nie znaleziono. Raport techniczny wydano jako publikację arXiv 2607.12894 — sprawdziliśmy, że numer należy do tego modelu, a nie do sąsiedniej pracy. Licencja to czysta Apache 2.0. Warto to powiedzieć wprost, bo bliźniaczy model HY-Embodied-0.5-X ma licencję społecznościową Tencenta, która nie obowiązuje w Unii Europejskiej, Wielkiej Brytanii i Korei Południowej. Firma wydaje oba warianty w obrębie jednej rodziny, więc licencję trzeba czytać osobno przy każdym modelu. Okno kontekstu to 32 768 tokenów — mało w porównaniu z modelami tłumaczeniowymi tej firmy i przypomnienie, że mamy do czynienia z modelem postrzegania i działania, a nie czytnikiem dokumentów. Przyjmuje do 128 obrazów w jednym poleceniu, w ich naturalnych proporcjach.

#embodied AI#robotics#vision-language#open weights#Apache 2.0#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję