Wszystkie newsyPremiery

Nowy model DeepSeeka bije Opusa i GPT w teście agentowym, w którym czołówka już się stłoczyła. W dwóch trudniejszych wersjach tego samego testu przegrywa o dwadzieścia punktów

Opublikowano: 12.09.2026 · Źródło: DeepSeek model card, DeepSeek-V4.1-Flash

DeepSeek opublikował 10 września 2026 roku model V4.1-Flash wraz z tabelą porównawczą, która wygląda na zwycięstwo na całej linii — dopóki nie prześledzi się jednego testu przez trzy jego wersje. W Terminal-Bench 2.1 nowy model uzyskuje 90,6 punktu, przed Opus-5.0 z 89,1 i GPT-5.6 Sol z 88,8. W Terminal-Bench 3.0 dostaje 30,0 wobec 43,3 dla Opus-5.0. W wersji 4.0 — 31,2 wobec 51,8. Te trzy liczby opisują ten sam model na tej samej rodzinie zadań, a rozrzut między nimi jest lekcją czytania testów. Wersja 2.1 krąży na tyle długo, że każde poważne laboratorium notuje w niej wynik pod dziewięćdziesiąt; przewaga półtora punktu dzieli tam modele w praktyce równie sprawne. Wersje 3.0 i 4.0 to trudniejsze odsłony napisane właśnie dlatego, że stara przestała modele rozróżniać — i tam dystans między modelem DeepSeeka a najdroższym modelem zachodnim wynosi około dwudziestu punktów. Ten sam wzór powtarza się w innych miejscach tabeli. W teście Humanity's Last Exam, wciąż dalekim od nasycenia, V4.1-Flash osiąga 36,8 wobec 56,3 dla Opus-5.0. W ProgramBench — 20,3 wobec 37,0. To, co model rzeczywiście wygrywa, warto powiedzieć wprost, bo nie jest to drobiazg. Jego ranking 3471 punktów w Codeforces jest najwyższy w tabeli. Rozwiązuje 74,2 procent zadań DeepSWE v1.1, prowadzi w CyberGym z wynikiem 88,1 i w AutomationBench z 54,8. A robi to, uruchamiając 8 miliardów parametrów na token przy czytaniu polecenia i 16 miliardów przy pisaniu odpowiedzi — z 552 miliardów w szkielecie. Właściwą wiadomością jest ta oszczędność. DeepSeek przebudował tę część modelu, która przechowuje przebieg rozmowy, i ściął pamięć trzymaną na jeden token do 890 bajtów, czyli około jednej czwartej tego, czego potrzebował model z lipca. Przez API firmy nowy model kosztuje 0,30 dolara za milion tokenów wejściowych w szczycie i 1,20 dolara za milion wyjściowych, wobec 0,44 i 1,32 dolara u poprzednika, a poza godzinami szczytu — połowę tego. Wagi są na licencji MIT i w kolejnych tygodniach pobrano je 140 636 razy. Czytana w całości tabela mówi coś pożyteczniejszego niż „najlepszy model”. Do pracy agentowej na dużą skalę, gdzie sesja na milion tokenów musi się zmieścić w budżecie, jest to narzędzie znakomite i za ułamek ceny czołówki. Do najtrudniejszego rozumowania, jakie da się dziś postawić, drogie modele pozostają z przodu — i mówią to liczby samego DeepSeeka.