MDL-5463EST.2026 · IDX.755
Model językowyW produkcji

Qwen3.5-397B-A17B

Alibaba Cloud · China · 2026

Flagowiec generacji Qwen3.5 i jeden z największych modeli, które można po prostu pobrać: 403 miliardy parametrów na licencji Apache 2.0, zestawione przez producenta wprost z GPT-5.2, Claude 4.5 Opus i Gemini 3 Pro.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Qwen3.5-397B-A17B, opublikowany 16 lutego 2026 r., otworzył generację Qwen3.5 tydzień przed resztą oferty. To flagowiec rodziny i — co przy tej skali rzadkie — nie jest schowany za interfejsem API: wagi leżą na Hugging Face na licencji Apache 2.0, bez żadnej bramki, obok wersji FP8, którą pobiera się trzy razy częściej niż pełną. Pliki wag zawierają 403,4 miliarda parametrów. Każdy token trafia do dziesięciu z 512 ekspertów plus jednego eksperta wspólnego, więc aktywnych jest około 17 miliardów — ta sama arytmetyka co u mniejszego rodzeństwa, tyle że w skali wymagającej niewielkiego klastra, a nie stacji roboczej. Alibaba zestawia go nie z modelami otwartymi, lecz z zamkniętą czołówką, i obraz jest taki, że model raz wygrywa, raz przegrywa. Prowadzi w zestawieniu na IFBench (76,5), MultiChallenge (67,6), NOVA-63 (59,1) i BrowseComp-zh (70,3), a w wiedzy i matematyce jest blisko: MMLU-Pro 87,8 wobec 89,8 dla Gemini 3 Pro, GPQA 88,4 wobec 92,4 dla GPT-5.2, AIME 2026 91,3 wobec 96,7. Wyraźnie ustępuje na Humanity's Last Exam (28,7 wobec 37,5) i w kodzie, gdzie SWE-bench Verified wynosi 76,4 wobec 80,9 dla Claude 4.5 Opus, a LiveCodeBench v6 83,6 wobec 90,7 dla Gemini 3 Pro. W widzeniu jest bliżej niż w tekście: MMMU 85,0 i MMMU-Pro 79,0, w obu przypadkach w granicach dwóch punktów od GPT-5.2 i Gemini 3 Pro. Wszystkie liczby pochodzą od producenta. Budowa to 60 warstw jako piętnaście powtórzeń trzech bloków Gated DeltaNet i jednego bloku uwagi bramkowanej, każdy zakończony mieszaniną ekspertów; wymiar ukryty 4096, 512 ekspertów o szerokości 1024, 32 głowice zapytań na dwie głowice klucza i wartości, słownik 248 320 tokenów, przewidywanie wielu tokenów naraz. Kontekst to 262 144 tokeny natywnie, według producenta rozciągalne do 1 010 000.

#open weights#mixture of experts#multimodal#China#agentic#flagship
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję