MiniMax-Text-01
MiniMax · China · 2025
Pierwszy model podstawowy MiniMaxa z otwartymi wagami: 456 miliardów parametrów, hybrydowa uwaga i okno kontekstu trenowane na milionie tokenów.
MiniMax-Text-01, opublikowany 15 stycznia 2025, to model, na którym szanghajskie laboratorium zbudowało swoją pozycję i wszystkie późniejsze wydania. To mieszanka ekspertów o łącznej liczbie 456 miliardów parametrów w 80 warstwach, w której na token aktywuje się dwóch ekspertów z 32 — czyli 45,9 miliarda parametrów. Do tej proporcji firma wracała w każdej kolejnej generacji. Jego znakiem rozpoznawczym jest budowa uwagi. Zamiast wszędzie stosować uwagę softmax, MiniMax przeplata ją z „lightning attention” — wariantem o koszcie liniowym — wstawiając jedną warstwę softmax po każdych siedmiu warstwach liniowych. Pełna uwaga rośnie kwadratowo wraz z długością sekwencji i to właśnie czyni długie okna kosztownymi; hybryda zostawia większość warstw liniowych, a drogi mechanizm rezerwuje dla jednej warstwy na osiem. Efekt, według producenta, to model trenowany przy kontekście miliona tokenów, który przy wnioskowaniu obsługuje do czterech milionów. W styczniu 2025 było to o rząd wielkości więcej niż u konkurencji z otwartymi wagami. Wagi objęte są własną umową modelową MiniMaxa, a nie licencją zatwierdzoną przez OSI — kod jest na MIT, wagi już nie. Model wciąż działa: niezależni dostawcy oferują go pod nazwą minimax-01 za około 0,20 dolara za milion tokenów wejścia i 1,10 dolara za milion wyjścia, a architektonicznie pozostaje rodzicem modelu MiniMax-M1.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!