DeepSeek-V4-Flash
DeepSeek · China · 2026
Oszczędny model linii V4 od DeepSeeka — MoE o 284 miliardach parametrów, z czego 13 miliardów aktywnych na token, na licencji MIT z otwartymi wagami.
DeepSeek-V4-Flash to kompaktowy przedstawiciel czwartej generacji modeli DeepSeeka, opublikowany najpierw jako wersja zapoznawcza w kwietniu 2026 razem ze znacznie większym V4-Pro. Jest to rzadki model mixture-of-experts o 284 miliardach parametrów, z czego na token aktywowanych jest około 13 miliardów; obsługuje okno kontekstu miliona tokenów i odpowiedzi o długości do 384 tysięcy tokenów. Raport techniczny opisuje hybrydowy mechanizm uwagi łączący uwagę skompresowaną i hiperpołączeniową, hiperpołączenia z ograniczeniem rozmaitości oraz optymalizator Muon, przy treningu na ponad 32 bilionach tokenów. Model działa wyłącznie na tekście — nie przyjmuje obrazu ani dźwięku. 31 lipca 2026 DeepSeek wydał rewizję 0731: tę samą architekturę po ponownym treningu końcowym, nastawioną na pracę agentową i inżynierię oprogramowania. Przyrosty okazały się nietypowo duże — wynik Terminal-Bench 2.1 wzrósł z 61,8 do 82,7, a DeepSWE z 7,3 do 54,4; niezależne testy Artificial Analysis dały modelowi 50 punktów w Intelligence Index, o dziesięć więcej niż poprzedniej wersji Flash. Wagi są opublikowane na Hugging Face na licencji MIT, a cennik API wynosi 0,14 dolara za milion tokenów wejściowych i 0,28 dolara za milion wyjściowych — to jedna z najniższych stawek dla modelu o takich możliwościach. Wcześniejszy DeepSeek-R1 pozostaje dostępny i ma własny profil w katalogu.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!