Wszystkie newsyBadania

Jedna firma, pięć premier i cztery różne sposoby mierzenia konkurencji. Każdy ujawniony, żaden w nagłówku

Opublikowano: 13.09.2026 · Źródło: Mistral AI — launch posts for Pixtral Large, Devstral, Mistral Medium 3, Devstral 2 and Mistral Small 4

Dzisiejszy dzień poszedł u nas na sprawdzanie, liczba po liczbie, czy wyniki testów w profilach Mistrala zgadzają się z komunikatami producenta. Liczby się obroniły. Nie obroniło się założenie, że można je zestawiać obok siebie. W pięciu komunikatach ta sama firma zmierzyła konkurencję na cztery różne sposoby — i za każdym razem to napisała, zdanie albo dwa pod nagłówkiem, który wszyscy cytują. Pixtral Large z listopada 2024 to przypadek rygorystyczny: rywali policzono „wspólnym harnessem testowym”, więc 69,4 procent w MathVista i wygrane z GPT-4o oraz Gemini 1.5 Pro w ChartQA i DocVQA znaczą dokładnie to, czego czytelnik się spodziewa. Devstral z maja 2025 to przypadek luźny. Własne 46,8 procent w SWE-bench Verified zmierzono w rusztowaniu OpenHands, ale tabela, w której model wyprzedza konkurencję zamkniętą, zestawia — słowami samego Mistrala — modele liczone „w dowolnym rusztowaniu (także przygotowanym pod dany model)”. W tym teście rusztowanie, czyli obudowa podająca modelowi repozytorium i uruchamiająca testy, samo w sobie bywa warte kilka punktów. Dlatego to nie jest pomiar w tych samych warunkach — i dlatego komunikat o tym mówi. Mistral Medium 3 z maja 2025 to przypadek mieszany i jedyny, w którym drobny druk kłóci się sam ze sobą. W tekście firma tłumaczy, że wzięła „liczby opublikowane wcześniej przez innych dostawców tam, gdzie były dostępne”, a resztę zmierzyła własnym harnessem. Gwiazdka pod wykresem na tej samej stronie głosi: „wyniki wszystkich testów uzyskano tym samym wewnętrznym potokiem ewaluacyjnym”. Oba zdania nie mogą być prawdziwe o jednej tabeli. A to na niej stoi nagłówkowa deklaracja: co najmniej 90 procent wyniku Claude Sonnet 3.7 w testach. Mistral Small 4 z tego roku dokłada wariant czwarty — asymetrię trybu. Wykres z wynikiem 0,72 w AA LCR przy 1,6 tysiąca znaków wyjścia opisano jako Mistral Small 4 z rozumowaniem, a model domyślnie tak nie pracuje: przy rozumowaniu wyłączonym zachowuje się, jak pisze Mistral, niczym Mistral Small 3.2. W jakim trybie puszczono modele konkurencji, komunikat nie podaje. Nic z tego nie jest nadużyciem i nie chodzi o to, że Mistral odstaje od reszty. Chodzi o to, że wynik testu to pomiar razem z metodą, a metoda źle znosi podróż: przeżywa komunikat premierowy i ginie w streszczeniu. Kontrprzykład też jest Mistrala — przy premierze Devstral 2 w grudniu 2025 firma zamówiła ocenę z udziałem ludzi u niezależnego dostawcy adnotacji, każdy model w rusztowaniu Cline, jedna reguła dla wszystkich, i opublikowała wynik: jej model wygrał z DeepSeek V3.2, a Claude Sonnet 4.5 pozostał wyraźnie preferowany. Dopiero wspólny harness sprawia, że przegraną da się opublikować. Sześć z ośmiu profili Mistrala w tym katalogu dostało dziś poprawkę, która stawia metodę obok liczby.