Model o 27 miliardach parametrów bije własnego flagowca o 397 miliardach — i remisuje z Claude 4.5 Opus w dwóch testach agentowych
Opublikowano: 2.09.2026 · Źródło: Alibaba, karta modelu Qwen3.6-27B (Hugging Face) i komunikat qwen.ai ↗
Qwen3.6-27B to model gęsty o 27,78 miliarda parametrów, z których wszystkie pracują przy każdym tokenie. We własnych tabelach producenta bije Qwen3.5-397B-A17B, czyli otwartego flagowca poprzedniej generacji o piętnastokrotnie większej liczbie parametrów, we wszystkich głównych testach programowania. Oba modele zmierzono w tej samej tabeli, ten sam zespół i to samo otoczenie agentowe — dzięki temu porównanie jest nietypowo czyste.
Liczby: SWE-bench Verified 77,2 wobec 76,2, SWE-bench Pro 53,5 wobec 50,9, SWE-bench Multilingual 71,3 wobec 69,3, Terminal-Bench 2.0 59,3 wobec 52,5, NL2Repo 36,2 wobec 32,2. W teście SkillsBench nie ma różnicy, jest przepaść: 48,2 wobec 30,0. W wewnętrznym rankingu producenta na generowanie stron: 1487 wobec 1186.
Dwie z tych liczb warto podać osobno, bo porównanie nie dotyczy tam modelu otwartego. Wobec Claude 4.5 Opus test Terminal-Bench 2.0 kończy się remisem 59,3, a SkillsBench wygrywa model chiński, 48,2 wobec 45,3.
Nie znaczy to jednak, że model o 27 miliardach parametrów dogonił czołówkę w ogóle. Wiersze dotyczące wiedzy odwracają obraz: MMLU-Pro 86,2 wobec 89,5 u Opusa, Humanity's Last Exam 24,0 wobec 30,8, SuperGPQA 66,0 wobec 70,6. Prawidłowość jest konsekwentna i warto ją nazwać. Wąska, sprawdzalna praca z narzędziami — poprawianie repozytorium kodu, obsługa terminala — to dokładnie to, co uczenie ze wzmocnieniem potrafi ocenić automatycznie, i tam liczba parametrów przestała rozstrzygać. Szeroka pamięć faktów nadal kosztuje parametry i ta różnica się nie domknęła.
Na jednym rozmiarze widać przez ten rok dłuższą linię. Alibaba wydała model o 27 miliardach parametrów trzy razy w pół roku: w lutym, kwietniu i sierpniu. W teście SWE-bench Pro wynik szedł 51,2, potem 53,5, potem 61,7 — ten sam sprzęt, dziesięć punktów w górę. Z zastrzeżeniem: sierpniowe liczby pochodzą z innej karty i częściowo innych wersji testów, więc tylko krok z lutego na kwiecień jest zmierzony w jednej tabeli.
Wagi na licencji Apache 2.0. Wszystkie wyniki pochodzą od producenta i nie zostały niezależnie powtórzone.