Newsy

Co słychać w robotyce i AI — wybór redakcji wujec.ai.

Premiery17.08.2026 · Qwen — karta modelu Qwen3.8-2.4T-A95B na Hugging Face

Pobierany flagowiec Alibaby to nie ten sam model, który firma wynajmuje — karta modelu wymienia cztery braki

Qwen3.8-Max, model o 2,446 biliona parametrów, którego wagi Alibaba opublikowała 8 sierpnia, jest pierwszym modelem klasy Max wydanym przez tę firmę do pobrania. Prawie żadne omówienie nie wspomina jednak, że plik do pobrania i model wołany przez API to nie ten sam produkt — a różnicę opisuje sama Alibaba, w nocie u góry karty modelu. Nota mówi, że wersja z API jest „oparta na" opublikowanym punkcie kontrolnym i ma „więcej funkcji, takich jak wejście obrazu i tryb bez rozumowania, milion tokenów kontekstu domyślnie, oficjalne narzędzia wbudowane". Czytana jako lista braków pobieranej wersji, daje cztery pozycje: - **Brak obrazu.** Repozytorium zawiera architekturę wyłącznie tekstową (`qwen3_5_moe_text`, znacznik `text-generation`). Hostowany Qwen3.8-Max przyjmuje zdjęcia i wideo; pobierany nie. - **Nie da się wyłączyć rozumowania.** Otwarty punkt kontrolny zawsze rozumuje przed odpowiedzią — głębokość reguluje `reasoning_effort`, ale tryb bez rozumowania istnieje tylko w API. - **262 144 tokenów, nie milion.** Karta podaje to wprost: 262 144 natywnie, z możliwością rozszerzenia do 1 010 000. Wersja hostowana ma milion domyślnie; kto uruchamia model u siebie, musi okno rozciągnąć sam i przyjąć konsekwencje dla jakości. - **Brak narzędzi wbudowanych.** Wyszukiwanie w sieci, uruchamianie kodu i reszta hostowanego zestawu należą do usługi, nie do wag. Nic z tego nie jest ukrywane — to jeden akapit we własnej karcie Alibaby, i właśnie dlatego warto go powtórzyć: krążące wyniki Qwen3.8-Max (Terminal-Bench 2.1 86,6, SWE-bench Pro 67,7, DeepSWE 1.1 56,6) zmierzono na konfiguracji hostowanej, a wdrożenie u siebie startuje z węższej. Karta rozstrzyga też, czym ten model jest architektonicznie — materiały premierowe mówiły o tym ogólnikami. To hybryda: 92 warstwy ułożone jako 23 powtórzenia trzech bloków Gated DeltaNet i jednego bloku uwagi bramkowanej, więc pełnej uwagi używa tylko co czwarta warstwa, a pozostałe korzystają z uwagi liniowej. W mieszance ekspertów jest ich 512, z czego na token uruchamia się 10 wybieranych i 1 wspólny. To ten układ sprawia, że 2,4 biliona parametrów kosztuje przy pracy 95 miliardów na token — i Qwen zastosował go po raz pierwszy w modelu flagowym. Nasz profil modelu ma już wpisane natywne okno kontekstu, architekturę hybrydową i wyraźną adnotację, że opublikowane wagi są wyłącznie tekstowe.

Qwen3.8-Max