MDL-9819EST.2025 · IDX.980
Model językowyW produkcji

DeepSeek-V3.2

DeepSeek · China · 2025

Ostatni model trzeciej generacji DeepSeeka: 685 miliardów parametrów, okno 163 840 tokenów i rzadka uwaga, wydany z otwartymi wagami na licencji MIT.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

DeepSeek-V3.2 zamyka trzecią generację modeli DeepSeeka. Wagi opublikowano na Hugging Face 1 grudnia 2025 — jedenaście miesięcy po DeepSeek-R1 i pięć miesięcy przed startem linii V4. To rzadki transformer z mieszanką ekspertów: 685 miliardów parametrów łącznie w 61 warstwach, 256 ekspertów kierowanych plus jeden współdzielony, osiem aktywnych na token, słownik 129 280 i okno kontekstu 163 840 tokenów. Wagi wydano w kwantyzacji FP8 w blokach 128×128, a karta modelu nie podaje, ile parametrów aktywuje się na token. Producent wymienia trzy zmiany wobec poprzedniego wydania. Rzadka uwaga DeepSeek Sparse Attention (DSA) obniża koszt mechanizmu uwagi, co dopiero czyni długie okno opłacalnym; rozbudowany etap uczenia ze wzmocnieniem podnosi rozumowanie i korzystanie z narzędzi; a osobny potok syntezy zadań agentowych dostarcza do tego danych treningowych. DeepSeek twierdzi, że model wypada porównywalnie z GPT-5, a wariant o zwiększonym budżecie obliczeń, DeepSeek-V3.2-Speciale, wypada lepiej — ze złotymi medalami Międzynarodowej Olimpiady Matematycznej i Międzynarodowej Olimpiady Informatycznej 2025. Same rozwiązania konkursowe firma dołączyła do repozytorium, co jest rzadkie i pozwala sprawdzić deklarację zamiast brać ją na słowo. Wariant Speciale jest przeznaczony do głębokiego rozumowania i — jak zaznacza sam producent — nie obsługuje wywoływania narzędzi. Model ma przełączany tryb myślenia w szablonie rozmowy oraz osobną rolę „developer" zarezerwowaną dla agentów wyszukujących. Repozytorium i wagi są na licencji MIT, tak jak reszta dorobku DeepSeeka aż po V4-Flash. W odczycie z 25 sierpnia 2026, dziewięć miesięcy po premierze, repozytorium notuje wciąż 1,18 miliona pobrań w trzydzieści dni — więcej niż aktualne wydanie flagowego V4-Pro.

#MoE#open weights#MIT license#sparse attention#reasoning#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję