Wszystkie newsyBadania

Tania Gemma przegrywa z flagowcem o dwa punkty — dopóki pytanie nie zrobi się trudne

Opublikowano: 25.08.2026 · Źródło: Google DeepMind, Gemma 4 26B A4B model card

W testach, które trafiają do nagłówków, Gemma 4 26B A4B jest o niecałe trzy punkty od flagowca 31B, choć na jeden token używa siódmej części jego parametrów. W najtrudniejszym egzaminie zestawu wypada poniżej połowy jego wyniku. Pobierana jest częściej niż flagowiec. Rodzina Gemma 4 od Google DeepMind zawiera dwa modele o zbliżonej wielkości, zbudowane na przeciwnych zasadach. Model 31B jest gęsty: nad każdym tokenem pracuje wszystkie 30,7 miliarda parametrów. Model 26B A4B to mieszanka ekspertów: przechowuje 25,2 miliarda parametrów, ale każdy token kieruje do 8 ze 128 ekspertów plus jednego współdzielonego, więc robotę wykonuje około 3,8 miliarda. Efekt liczy się niemal tak szybko jak model czteromiliardowy. Własna tabela wyników producenta, opublikowana na karcie modelu, pokazuje, ile to kosztuje — a odpowiedź zależy wyłącznie od tego, który wiersz się czyta. W standardowych miarach oba modele są blisko siebie. MMLU Pro: 82,6 procent wobec 85,2. AIME 2026 bez narzędzi: 88,3 wobec 89,2, czyli różnica poniżej jednego punktu na olimpijskim egzaminie z matematyki. GPQA Diamond: 82,3 wobec 84,3. Wielojęzyczne MMLU: 86,3 wobec 88,4. To są liczby, które trafiają do komunikatów premierowych i tabel porównawczych, i w nich mieszanka ekspertów przegrywa o jeden do trzech punktów. Potem zadania robią się trudniejsze i obraz się zmienia. W teście Humanity's Last Exam bez narzędzi model 26B osiąga 8,7 procent wobec 19,5 flagowca — poniżej połowy. W BigBench Extra Hard jest to 64,8 wobec 74,4. Na Codeforces różnica wynosi 1718 punktów Elo wobec 2150, co w programowaniu zawodniczym oznacza raczej inną ligę niż niższe miejsce. A w wyszukiwaniu informacji w kontekście 128 tysięcy tokenów model 26B uzyskuje 44,1 procent wobec 66,4 — załamanie o 22 punkty dokładnie w tej pracy, dla której kupuje się długie okno kontekstu. Wzór jest konsekwentny. Tam, gdzie na pytanie da się odpowiedzieć z wiedzy rozłożonej szeroko, skierowanie tokenu do garstki ekspertów nie kosztuje prawie nic. Tam, gdzie odpowiedź wymaga utrzymania naraz wielu różnych kawałków wiedzy — najtrudniejsze rozumowanie, długie dokumenty, kod zawodniczy — okazuje się, że parametry, których nie uruchomiono, były jednak potrzebne. Rynkowi zdaje się to nie przeszkadzać. W odczycie z 25 sierpnia 2026 repozytorium wersji instrukcyjnej 26B notuje 8,94 miliona pobrań w trzydzieści dni wobec 8,79 miliona dla 31B. Tańszy model jest najczęściej pobieranym członkiem rodziny i o niewielki margines wyprzedza flagowca. W ogromnej większości realnej pracy dwa punkty to różnica, której nikt nie odczuje — a ostatnią milę sprawności, tę kosztującą siedmiokrotnie więcej obliczeń na token, kupuje stosunkowo niewielu. Wszystkie pięć rozmiarów Gemmy 4 ma już profile w katalogu.