gte-modernbert-base
Alibaba Cloud · China · 2025
Angielski model indeksujący Alibaby, nietypowy z jednego powodu: to dostrojenie ModernBERT-a, enkodera opublikowanego przez dwie inne firmy. Przy 149 milionach parametrów czyta 8192 tokeny naraz, podczas gdy zastępowane przez niego modele BERT kończyły na 512.
gte-modernbert-base, opublikowany przez laboratorium Tongyi Alibaby 20 stycznia 2025 roku, zamienia fragment angielskiego tekstu w 768 liczb. Wyszukiwarka zapisuje te liczby dla każdego indeksowanego dokumentu i odnajduje materiały pokrewne, mierząc odległość między nimi. Model nie odpowiada na pytania i nie prowadzi rozmowy — to instalacja pod okienkiem wyszukiwania albo pod czatem, który doczytuje dokumenty. Model ma 149 milionów parametrów w 22 warstwach, wymiar ukryty 768, słownik 50 368 i przyjmuje do 8192 tokenów wejścia. To okno jest sednem tego wydania. Enkodery z rodziny BERT, które przez lata obsługiwały to zadanie, kończyły na 512 tokenach, więc każdy długi dokument trzeba było siekać na kawałki i tracić związki między nimi. Szesnastokrotnie większe okno oznacza, że cały artykuł, umowa albo instrukcja mieszczą się w jednym kawałku. Jedną rzecz w tym wydaniu warto powiedzieć wprost: Alibaba nie zbudowała tego enkodera. Model jest dostrojeniem ModernBERT-base, opublikowanego w grudniu 2024 roku przez Answer.AI i LightOn — widać to w pliku konfiguracyjnym, gdzie co trzecia warstwa patrzy na cały tekst, a pozostałe pracują na lokalnym oknie 128 tokenów, co jest pomysłem ModernBERT-a, nie Alibaby. Chińska firma dołożyła uczenie kontrastowe, które zmienia ogólny enkoder w model wyszukiwawczy, i nic poniżej tej warstwy. Według liczb producenta model osiąga 64,38 w MTEB English, 55,33 w wyszukiwaniu BEIR, 87,57 w długokontekstowym zestawie LoCo i 79,31 w kodowym CoIR. Wynik długokontekstowy jest konsekwencją architektury i to właśnie tam przewaga nad poprzednikami z oknem 512 tokenów jest największa. Wagi są na Apache 2.0, bez dodatkowych ograniczeń. W 30 dniach do 23 września 2026 roku model pobrano 158 273 razy przy 201 polubieniach na Hugging Face — przyzwoicie, ale znacznie słabiej niż wydany tego samego dnia model przestawiający wyniki, który ma szesnastokrotnie większy ruch przy dwa razy mniejszej liczbie polubień.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!