MDL-5937EST.2025 · IDX.284
Model językowyW produkcji

MiniMax-Text-01

MiniMax · China · 2025

Pierwszy model podstawowy MiniMaxa z otwartymi wagami: 456 miliardów parametrów, hybrydowa uwaga i okno kontekstu trenowane na milionie tokenów.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

MiniMax-Text-01, opublikowany 15 stycznia 2025, to model, na którym szanghajskie laboratorium zbudowało swoją pozycję i wszystkie późniejsze wydania. To mieszanka ekspertów o łącznej liczbie 456 miliardów parametrów w 80 warstwach, w której na token aktywuje się dwóch ekspertów z 32 — czyli 45,9 miliarda parametrów. Do tej proporcji firma wracała w każdej kolejnej generacji. Jego znakiem rozpoznawczym jest budowa uwagi. Zamiast wszędzie stosować uwagę softmax, MiniMax przeplata ją z „lightning attention” — wariantem o koszcie liniowym — wstawiając jedną warstwę softmax po każdych siedmiu warstwach liniowych. Pełna uwaga rośnie kwadratowo wraz z długością sekwencji i to właśnie czyni długie okna kosztownymi; hybryda zostawia większość warstw liniowych, a drogi mechanizm rezerwuje dla jednej warstwy na osiem. Efekt, według producenta, to model trenowany przy kontekście miliona tokenów, który przy wnioskowaniu obsługuje do czterech milionów. W styczniu 2025 było to o rząd wielkości więcej niż u konkurencji z otwartymi wagami. Wagi objęte są własną umową modelową MiniMaxa, a nie licencją zatwierdzoną przez OSI — kod jest na MIT, wagi już nie. Model wciąż działa: niezależni dostawcy oferują go pod nazwą minimax-01 za około 0,20 dolara za milion tokenów wejścia i 1,10 dolara za milion wyjścia, a architektonicznie pozostaje rodzicem modelu MiniMax-M1.

#open weights#long context#lightning attention#mixture of experts
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję