DeepSeek-V3.1
DeepSeek · China · 2025
Jeden model z przełącznikiem myślenia: DeepSeek wchłonął tu własną linię rozumującą i wyuczył go w formacie danych pisanym pod chińskie układy.
DeepSeek-V3.1, opublikowany 21 sierpnia 2025, to wydanie, w którym firma przestała wypuszczać modele rozumujące osobno. To model hybrydowy: te same wagi odpowiadają od razu albo najpierw myślą, a wybiera się to szablonem rozmowy, nie zmianą modelu. Porównanie samego producenta jest bezceremonialne — wersja myśląca dorównuje jakością odpowiedzi modelowi DeepSeek-R1-0528, a odpowiada szybciej. Douczanie objęło też wywoływanie narzędzi i zadania agentowe, przy czym narzędzia działają w trybie bez myślenia. Pod spodem pracuje wciąż korpus V3: 671 miliardów parametrów przy 37 miliardach aktywnych na token, 61 warstw, 256 ekspertów kierowanych plus jeden współdzielony, osiem aktywnych na token i okno 128K (163 840 tokenów). Zmieniło się to, jak to okno wypracowano. V3.1 douczono na punkcie bazowym zbudowanym z pierwotnej bazy V3 dwufazowym rozszerzaniem kontekstu: faza 32K urosła dziesięciokrotnie, do 630 miliardów tokenów, a faza 128K 3,3-krotnie, do 209 miliardów tokenów. To bardzo dużo obliczeń wydanych wyłącznie na długie dokumenty. Najcichszym szczegółem jest arytmetyka. DeepSeek uczył V3.1 w formacie skali UE8M0 FP8 zarówno dla wag, jak i aktywacji, podając jako cel zgodność z formatami mikroskalowanymi. Mówiąc wprost: model uformowano tak, by liczył się na układach, które jego rodzimy rynek jest w stanie kupić. W odróżnieniu od pierwszego V3 wagi są tu na licencji MIT, w jednym pliku obejmującym i kod, i model.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!