Nowszy Qwen przegrywa ze starszym w większości testów — a plik konfiguracyjny mówi dlaczego
Opublikowano: 2.09.2026 · Źródło: Alibaba, karta modelu Qwen3.6-35B-A3B (Hugging Face) ↗
Pierwszy model linii Qwen3.6 z otwartymi wagami ma w karcie tabelę porównawczą, w której własny model tej samej firmy sprzed siedmiu tygodni wypada lepiej w większości wierszy. Numer wersji przeszedł z 3.5 na 3.6; plik konfiguracyjny w repozytorium nadal opisuje architekturę jako qwen3_5_moe.
Według liczb producenta Qwen3.5-27B bije nowszy Qwen3.6-35B-A3B na SWE-bench Verified (75,0 wobec 73,4), SWE-bench Multilingual (69,3 wobec 67,2), SWE-bench Pro (51,2 wobec 49,5), MMLU-Pro (86,1 wobec 85,2) i Humanity's Last Exam (24,3 wobec 21,4). Cztery z tych pięciu to testy, na które kupujący patrzy najpierw.
Nowszy model wygrywa zestaw węższy i bardziej konkretny. Terminal-Bench 2.0 rośnie z 41,6 na 51,5 — dziesięć punktów w teście sprawdzającym, czy model potrafi pracować w wierszu poleceń bez człowieka. QwenWebBench rośnie z 1068 na 1397. NL2Repo, który każe zbudować repozytorium, a nie tylko je poprawić, rośnie z 27,3 na 29,4. To są zadania, przy których samodzielny agent pracuje minutami, wywołując narzędzia w pętli.
Podział tłumaczy konstrukcja. Qwen3.5-27B jest gęsty: wszystkie 27,78 miliarda parametrów liczy przy każdym tokenie. Qwen3.6-35B-A3B to mieszanka ekspertów — 35,95 miliarda parametrów w pamięci, 256 ekspertów, z których na token uruchamia się 8 wybranych i 1 wspólny, czyli aktywne są mniej więcej 3 miliardy. Na token kosztuje więc jakąś ósmą część tego, co model gęsty. Agent wykonujący setki wywołań narzędzi, żeby domknąć jedno zadanie, płaci ten koszt setki razy; czat, który odpowiada raz, płaci go raz.
Nowsze wydanie nie jest zatem modelem lepszym. Jest tańsze, straciło niewiele, a zyskało tam, gdzie koszt ma znaczenie. Alibaba też go nie przechwala — nota wydawnicza opisuje pracę jako zbudowaną na uwagach społeczności i stawiającą na „stabilność i praktyczną przydatność”, a wobec faktycznego poprzednika o tej samej wielkości i rzadkości, modelu Qwen3.5-35B-A3B, postęp nie budzi wątpliwości: Terminal-Bench z 40,5 na 51,5, QwenWebBench z 978 na 1397, NL2Repo z 20,5 na 29,4.
Nota przemilcza natomiast pole model_type. Podniesienie numeru wersji przy nietkniętym oznaczeniu architektury to poprawka w treningu końcowym i uczeniu ze wzmocnieniem, a nie nowa rodzina — warto o tym wiedzieć, zanim się założy, że wyższy numer znaczy przebudowany model.
Jest i drugi wniosek, mniej pochlebny dla całej branży. Ta sama karta, która przypisuje modelowi Qwen3.5-27B wynik 75,0 na SWE-bench Verified, sąsiaduje z własną kartą tego modelu, gdzie stoi 72,4. Alibaba nie tłumaczy różnicy 2,6 punktu; starsze repozytorium zaktualizowano tego samego dnia, w którym ukazała się nowsza karta. Obie liczby pochodzą od producenta i żadnej nie powtórzono niezależnie.
Do katalogu trafiły trzy profile z tych dwóch generacji: Qwen3.5-9B, Qwen3.5-27B i Qwen3.6-35B-A3B. Wszystkie na licencji Apache 2.0.