MDL-4497EST.2026 · IDX.743
Model językowyW produkcji

DiffusionGemma 26B A4B

Google DeepMind · USA · 2026

Eksperymentalna Gemma, która nie pisze słowo po słowie. Odszumia całe bloki po 256 tokenów naraz i generuje tekst nawet czterokrotnie szybciej niż Gemma 4 — oraz, według własnych pomiarów Google, wyraźnie gorzej.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

DiffusionGemma to eksperymentalny model o otwartych wagach, który Google DeepMind ogłosił 10 czerwca 2026, żeby sprawdzić inny sposób wytwarzania tekstu. Zwykłe modele językowe pracują jak maszyna do pisania: token po tokenie, każdy zależny od poprzednich. DiffusionGemma zamiast tego szkicuje od razu cały blok 256 tokenów — karta modelu nazywa go płótnem — a potem dopracowuje go w maksymalnie 48 krokach odszumiania, dzięki czemu każdy token w bloku widzi wszystkie pozostałe. Ten chwyt, zapożyczony z dyfuzji obrazu i z wcześniejszych badań Google nad Gemini Diffusion, zamienia generowanie z problemu przepustowości pamięci w problem mocy obliczeniowej — czyli dokładnie w taką pracę, do jakiej nadaje się bezczynna karta graficzna w domowym komputerze. Spodem jest mieszanka ekspertów Gemma 4 26B A4B: 30 warstw, 8 aktywnych ekspertów ze 128 plus jeden współdzielony, około 3,8 miliarda parametrów pracujących nad tokenem z 25,2 miliarda łącznie, kontekst 256 000 tokenów i koder obrazu o mniej więcej 550 milionach parametrów. Nowy jest kształt samego liczenia. Autoregresyjny koder czyta polecenie i wypełnia pamięć podręczną kluczy i wartości, a dekoder stosuje uwagę dwukierunkową w obrębie płótna i oddaje każdy gotowy blok z powrotem koderowi. Google podaje ponad 1000 tokenów na sekundę na pojedynczej karcie NVIDIA H100 i ponad 700 na GeForce RTX 5090, przy czym wersja skwantyzowana mieści się w 18 GB pamięci graficznej. Niezwykłe w tym wydaniu jest to, jak otwarcie producent mówi o cenie tej szybkości. Google publikuje DiffusionGemmę obok autoregresyjnej Gemmy 4, na której ją zbudował, i własny model przegrywa niemal każde porównanie: 77,6 procent wobec 82,6 w MMLU Pro, 69,1 wobec 88,3 w AIME 2026 bez narzędzi, 73,2 wobec 82,3 w GPQA Diamond, 54,3 wobec 73,8 w MMMU Pro, ranking Codeforces 1429 wobec 1718. Jedyny test, który wygrywa, to Humanity's Last Exam bez narzędzi — 11,0 wobec 8,7 procent. We wpisie na blogu pada to wprost: tam, gdzie liczy się najwyższa jakość, należy wdrażać zwykłą Gemmę 4. DiffusionGemma jest pomyślana do zastosowań lokalnych o niskim opóźnieniu, w których praca całym blokiem jest przewagą strukturalną, a nie kompromisem — poprawianie tekstu w miejscu, uzupełnianie kodu i zadania, w których tokeny zależą od siebie w obie strony. Własny przykład Google to dostrojona wersja rozwiązująca sudoku, czyli zadanie sprawiające autoregresyjnym modelom kłopot, bo każde pole zależy od pól jeszcze nienapisanych.

#open weights#Apache 2.0#text diffusion#mixture of experts#experimental
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję