MDL-9252EST.2025 · IDX.818
Model językowyW produkcji

MiniMax-M1

MiniMax · China · 2025

Pierwszy duży model rozumujący z otwartymi wagami i uwagą hybrydową — i jedyny flagowiec MiniMaxa wydany na licencji Apache 2.0.

Ocena wujec.ai

–/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

MiniMax-M1, wydany w czerwcu 2025, to pierwszy model rozumujący tego laboratorium i — według jego własnego opisu — pierwszy na świecie duży model rozumujący z otwartymi wagami i uwagą hybrydową. Nie jest to nowy model bazowy: w całości wykorzystuje MiniMax-Text-01 — te same 456 miliardów parametrów, te same 45,9 miliarda aktywnych na token, tę samą budowę uwagi — i dokłada do niego uczenie ze wzmocnieniem na dużą skalę. Pliki wag M1 i Text-01 mają co do bajta ten sam rozmiar. Cała praca poszła w uczenie ze wzmocnieniem. MiniMax przedstawił przy tej okazji algorytm CISPO, który przycina wagi próbkowania ważonego zamiast aktualizacji tokenów; producent podaje, że przy tym samym budżecie wypada lepiej niż konkurencyjne warianty. Uwaga hybrydowa opłaca się przy długich łańcuchach rozumowania: przy generacji o długości 100 tysięcy tokenów M1 zużywa według producenta jedną czwartą operacji zmiennoprzecinkowych modelu DeepSeek-R1, a natywnie obsługuje kontekst miliona tokenów — ośmiokrotnie większy niż R1. M1 ukazał się w dwóch odmianach różniących się wyłącznie budżetem myślenia: 40 i 80 tysięcy tokenów rozumowania. Więcej myślenia nie znaczy jednak lepiej. We własnej tabeli producenta odmiana 40K czyta długi kontekst dokładniej niż 80K — 76,1 wobec 73,4 pkt w teście OpenAI-MRCR przy 128 tys. tokenów i 58,6 wobec 56,2 przy milionie — a do tego wygrywa handlową część testu TAU-bench, 67,8 wobec 63,5. Najczęściej cytowana liczba M1, czyli 73,4, jest więc słabszym z dwóch wyników, a Gemini 2.5 Pro stoi ponad obiema odmianami z wynikiem 76,8. Tabelę porównawczą warto czytać w obie strony. MiniMax pisze, że M1 wypada lepiej niż mocne modele z otwartymi wagami, na przykład pierwotny DeepSeek-R1 — i wobec tamtego wydania ze stycznia 2025 to prawda. W tej samej tabeli stoi jednak druga kolumna DeepSeeka, wersja R1-0528 z maja 2025, która bije M1-80K w 13 z 16 wierszy podanych dla obu modeli. Trzy wygrane M1 to czytanie długiego kontekstu (OpenAI-MRCR przy 128 tys. tokenów i LongBench-v2) oraz lotnicza część testu TAU-bench. Dwa wiersze nie są przy tym mierzone tak samo: wynik 56,0 w SWE-bench Verified powstał na firmowym, dwuetapowym rusztowaniu Agentless i na 486 z 500 zadań, które działały na infrastrukturze producenta, a wyniki HLE oznaczone gwiazdką — w tym wynik M1 — pochodzą z podzbioru wyłącznie tekstowego, podczas gdy nieoznaczone liczby Claude'a, Gemini i o3 w tym samym wierszu już nie. Wyjątkowa jest licencja M1. Wcześniejszy Text-01 i wszystkie późniejsze wydania linii M2 mają warunki własne producenta; sam M1 jest na Apache 2.0, której nie da się cofnąć. Niezależni dostawcy hostują go do dziś za około 0,55 dolara za milion tokenów wejścia i 2,20 dolara za milion wyjścia — czyli drożej niż nowszy MiniMax M3 z większym kontekstem.

#open weights#reasoning#long context#Apache 2.0
Strona oficjalna ↗

▸Wideo

Brak materiałów wideo.

▸Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję