EmbeddingGemma 300M
Google · USA · 2025
Model osadzeń tekstu o 308 milionach parametrów, który prowadzi wyszukiwanie i RAG w całości na telefonie — poniżej 200 MB pamięci po kwantyzacji, w ponad stu językach i bez połączenia z siecią.
EmbeddingGemma to mały model osadzeń tekstu Google, ogłoszony 4 września 2025. Nie generuje tekstu: zamienia zdanie albo dokument w wektor, a to podstawa wyszukiwania, generowania wspartego wyszukiwaniem (RAG), klasyfikacji i grupowania. Model zbudowano z Gemmy 3 z inicjalizacją z T5Gemmy i nauczono na danych w ponad stu językach — ale cały jego sens to rozmiar. Przy 308 milionach parametrów mieści się, po treningu ze świadomością kwantyzacji, w mniej niż 200 MB pamięci, a osadzenie 256 tokenów wejścia liczy poniżej 15 milisekund na układzie EdgeTPU. To znaczy indeks wyszukiwania i cały potok RAG działające wyłącznie na telefonie, bez wypuszczania tekstu poza urządzenie. Wektor wyjściowy ma 768 liczb, ale dzięki technice Matryoshka Representation Learning można go skrócić do 512, 256 albo 128 i znormalizować ponownie — im krótszy wektor, tym tańszy indeks i szybsze wyszukiwanie. Google podaje wprost, ile to kosztuje: w wielojęzycznym teście MTEB wynik spada z 61,15 przy 768 wymiarach do 58,23 przy 128, w zestawie angielskim z 69,67 do 66,66, a najmocniej w zestawie kodu — z 68,76 do 62,96. Kwantyzacja kosztuje przy tym uderzająco mało: punkt kontrolny czterobitowy osiąga 60,62 w wielojęzycznym MTEB wobec 61,15 dla modelu w pełnej precyzji. Google twierdzi, że to najwyżej sklasyfikowany otwarty wielojęzyczny model osadzeń poniżej 500 milionów parametrów w rankingu MTEB, porównywalny z modelami prawie dwa razy większymi. Ograniczenia są wyraźne: okno kontekstu to 2048 tokenów, więc dłuższe dokumenty trzeba dzielić na fragmenty, a aktywacje nie obsługują formatu float16 — trzeba użyć bfloat16 albo float32. Wagi wydano na warunkach Gemmy, które dopuszczają użycie komercyjne, ale wymagają akceptacji licencji na Hugging Face i przekazania polityki użycia dalej. W zaleceniu samego Google podział pracy jest prosty: EmbeddingGemma do tego, co liczy się na urządzeniu, a interfejs Gemini Embedding do tego, co liczy się w chmurze.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!