MDL-6826EST.2026 · IDX.606
Model językowyW produkcji

DeepSeek-V4-Flash

DeepSeek · China · 2026

Oszczędny model linii V4 od DeepSeeka — MoE o 284 miliardach parametrów, z czego 13 miliardów aktywnych na token, na licencji MIT z otwartymi wagami.

Ocena wujec.ai

8.7/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

DeepSeek-V4-Flash to kompaktowy przedstawiciel czwartej generacji modeli DeepSeeka, opublikowany najpierw jako wersja zapoznawcza w kwietniu 2026 razem ze znacznie większym V4-Pro. Jest to rzadki model mixture-of-experts o 284 miliardach parametrów, z czego na token aktywowanych jest około 13 miliardów; obsługuje okno kontekstu miliona tokenów i odpowiedzi o długości do 384 tysięcy tokenów. Raport techniczny opisuje hybrydowy mechanizm uwagi łączący uwagę skompresowaną i hiperpołączeniową, hiperpołączenia z ograniczeniem rozmaitości oraz optymalizator Muon, przy treningu na ponad 32 bilionach tokenów. Model działa wyłącznie na tekście — nie przyjmuje obrazu ani dźwięku. 31 lipca 2026 DeepSeek wydał rewizję 0731: tę samą architekturę po ponownym treningu końcowym, nastawioną na pracę agentową i inżynierię oprogramowania. Przyrosty okazały się nietypowo duże — wynik Terminal-Bench 2.1 wzrósł z 61,8 do 82,7, a DeepSWE z 7,3 do 54,4; niezależne testy Artificial Analysis dały modelowi 50 punktów w Intelligence Index, o dziesięć więcej niż poprzedniej wersji Flash. Wagi są opublikowane na Hugging Face na licencji MIT, a cennik API wynosi 0,14 dolara za milion tokenów wejściowych i 0,28 dolara za milion wyjściowych — to jedna z najniższych stawek dla modelu o takich możliwościach. Wcześniejszy DeepSeek-R1 pozostaje dostępny i ma własny profil w katalogu.

#MoE#open weights#MIT license#long context#agentic coding#China
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję