MDL-9818EST.2025 · IDX.979
Model językowyW produkcji

DeepSeek-V3.1

DeepSeek · China · 2025

Jeden model z przełącznikiem myślenia: DeepSeek wchłonął tu własną linię rozumującą i wyuczył go w formacie danych pisanym pod chińskie układy.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

DeepSeek-V3.1, opublikowany 21 sierpnia 2025, to wydanie, w którym firma przestała wypuszczać modele rozumujące osobno. To model hybrydowy: te same wagi odpowiadają od razu albo najpierw myślą, a wybiera się to szablonem rozmowy, nie zmianą modelu. Porównanie samego producenta jest bezceremonialne — wersja myśląca dorównuje jakością odpowiedzi modelowi DeepSeek-R1-0528, a odpowiada szybciej. Douczanie objęło też wywoływanie narzędzi i zadania agentowe, przy czym narzędzia działają w trybie bez myślenia. Pod spodem pracuje wciąż korpus V3: 671 miliardów parametrów przy 37 miliardach aktywnych na token, 61 warstw, 256 ekspertów kierowanych plus jeden współdzielony, osiem aktywnych na token i okno 128K (163 840 tokenów). Zmieniło się to, jak to okno wypracowano. V3.1 douczono na punkcie bazowym zbudowanym z pierwotnej bazy V3 dwufazowym rozszerzaniem kontekstu: faza 32K urosła dziesięciokrotnie, do 630 miliardów tokenów, a faza 128K 3,3-krotnie, do 209 miliardów tokenów. To bardzo dużo obliczeń wydanych wyłącznie na długie dokumenty. Najcichszym szczegółem jest arytmetyka. DeepSeek uczył V3.1 w formacie skali UE8M0 FP8 zarówno dla wag, jak i aktywacji, podając jako cel zgodność z formatami mikroskalowanymi. Mówiąc wprost: model uformowano tak, by liczył się na układach, które jego rodzimy rynek jest w stanie kupić. W odróżnieniu od pierwszego V3 wagi są tu na licencji MIT, w jednym pliku obejmującym i kod, i model.

#MoE#open weights#MIT license#hybrid reasoning#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję