Qwen3-30B-A3B-Thinking-2507
Alibaba Cloud · China · 2025
Rozumująca połowa rozbicia: model 30 mld, który wyłącznie myśli — i w firmowych testach matematycznych wyprzedza własnego flagowca o 235 mld parametrów.
To druga połowa decyzji, którą Alibaba podjęła latem 2025 roku. Kwietniowy Qwen3-30B-A3B miał w jednym komplecie wag przełącznik między myśleniem a odpowiadaniem wprost; lipcowe wydanie instrukcyjne zachowało sam tryb bezpośredni, a to wydanie — sam tryb myślenia. Nie da się go z myślenia wyprosić: szablon rozmowy sam otwiera blok rozumowania, dlatego w odpowiedziach widać często znacznik zamykający bez widocznego otwierającego. Sama sieć jest ta sama co w kwietniu: 30,5 mld parametrów, 128 ekspertów na 48 warstwach, ośmiu wybieranych na token, czyli około 3,3 mld aktywnych. Kontekst rośnie do 262 144 tokenów natywnie. Producent uczciwie ostrzega, że ta wersja myśli dłużej od poprzedniczki i zaleca ją wyłącznie do naprawdę trudnych zadań — a ta dłuższa myśl to tokeny na rachunku. Względem modelu kwietniowego w tym samym trybie producent podaje wzrost AIME25 z 70,9 do 85,0, HMMT25 z 49,8 do 71,4, LiveCodeBench v6 z 57,4 do 66,0 i Arena-Hard v2 z 36,3 do 56,0. Zatrzymać się warto przy pierwszej liczbie: 85,0 w AIME25 to więcej niż 81,5, które ta sama tabela daje firmowemu flagowcowi o 235 mld parametrów w trybie myślenia, i wyraźnie więcej niż 72,0 dla Gemini 2.5 Flash Thinking. To liczby podane przez producenta i dotyczą jednego zestawu zadań z olimpiady matematycznej, a w tej samej tabeli model wyraźnie przegrywa z Gemini w teście GPQA (73,4 wobec 82,8) — ale model 30 mld bijący model 235 mld w choćby jednym nagłówkowym teście to wynik, który ukształtował ówczesne myślenie rynku otwartych wag o rozmiarze modeli. Wagi na licencji Apache 2.0, z użyciem komercyjnym włącznie.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!