MDL-7158EST.2026 · IDX.056
Model językowyW produkcji

DeepSeek-V4.1-Flash

DeepSeek · China · 2026

Najtańszy model DeepSeeka z czołowej półki: mieszanka ekspertów o 552 miliardach parametrów, która pracuje na ośmiu miliardach na token i utrzymuje milionową rozmowę kosztem 890 bajtów pamięci na token.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

DeepSeek-V4.1-Flash, opublikowany 10 września 2026 roku na licencji MIT, jest uderzeniem w koszt prowadzenia długich rozmów, a nie w rankingi. Jego najważniejsza liczba nie jest wynikiem testu, tylko miarą pamięci: 890 bajtów podręcznej pamięci klucz-wartość na token, czyli około jednej czwartej tego, czego sześć tygodni wcześniej potrzebował jego własny poprzednik, i — według wyliczeń DeepSeeka — 437 razy mniej niż pierwszy model firmy. Ma to znaczenie, bo pamięć klucz-wartość to właśnie to, co asystent musi trzymać w pamięci, żeby pamiętać, co już zostało powiedziane. W sesji na milion tokenów jest kosztem dominującym i to ona sprawia, że modele o długim kontekście są drogie w obsłudze, a nie w uczeniu. DeepSeek atakuje ją z kilku stron naraz: układem przyczynowym koder-dekoder, w którym dwadzieścia warstw dekodera pobiera wspólną pamięć ze stanów końcowych kodera, zamiast budować własną; schematem uwagi przypisującym każdej warstwie jedną z trzech stałych ról, dzięki czemu warstwy współdzielą i ponownie wykorzystują struktury indeksu; oraz przechowywaniem tej pamięci w czterobitowej liczbie zmiennoprzecinkowej. Efekt: model uruchamia 8 miliardów parametrów przy czytaniu polecenia i 16 miliardów przy pisaniu odpowiedzi, z 552 miliardów w szkielecie — podczas gdy większy V4-Pro uruchamia 49 miliardów z 1,6 biliona. Oszczędność trafia do cennika. Przez API DeepSeeka model kosztuje 0,30 dolara za milion tokenów wejściowych w godzinach szczytu i 1,20 dolara za milion tokenów wyjściowych, a poza szczytem dokładnie połowę — wobec 0,44 i 1,32 dolara za model, który zastępuje. Przejął też zwykłą nazwę `deepseek-flash`, przy czym starsze identyfikatory są nadal przyjmowane. We własnej tabeli porównawczej producenta prowadzi w kilku testach agentowych: 90,6 punktu w Terminal-Bench 2.1, 74,2 rozwiązanych zadań w DeepSWE v1.1, 88,1 w CyberGym, 54,8 w AutomationBench i ranking 3471 punktów w Codeforces — każdy wynik powyżej Opus-5.0, GPT-5.6 Sol i własnego, większego rodzeństwa. Czytelnik porównujący modele powinien jednak spojrzeć o wiersz niżej w tej samej tabeli. W Terminal-Bench 3.0 i 4.0 — nowszych, trudniejszych wersjach testu, który wygrywa w odsłonie 2.1 — uzyskuje 30,0 i 31,2 punktu wobec 43,3 i 51,8 dla Opus-5.0. W teście Humanity's Last Exam osiąga 36,8 wobec 56,3. Wzór jest konsekwentny: tam, gdzie test jest dojrzały, a czołówka stłoczona, ten model jest na przedzie; tam, gdzie test wciąż potrafi różnicować, dystans do najdroższych modeli zachodnich jest duży. To znakomite narzędzie do pracy agentowej wrażliwej na koszt, a nie pretensja do czołówki rozumowania. Model jest natywnie wielomodalny — czyta obrazy przez moduł wizyjny, który DeepSeek wyuczył od zera — i został wstępnie nauczony na 45 bilionach tokenów wielomodalnych. Wysiłek rozumowania jest pokrętłem od 1 do 100, a nie przełącznikiem. Wagi, raport techniczny i licencja opublikowane razem; popularność w 30 dniach do 16 września 2026: 140 636 pobrań z Hugging Face.

#MoE#open weights#MIT license#long context#agentic coding#multimodal#China
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję