DeepSeek-R1-0528
DeepSeek · China · 2025
Majowa przebudowa modelu DeepSeek-R1: wynik na AIME 2025 wzrósł z 70 do 87,5 procent, a model zużywa teraz na jedno zadanie 23 tysiące tokenów myślenia zamiast 12 tysięcy.
DeepSeek nazwał to drobną aktualizacją wersji. Liczby mówią co innego. Opublikowany 28 maja 2025 na tym samym korpusie 671 miliardów parametrów co DeepSeek-R1, model R1-0528 podniósł wynik na zestawie matematycznym AIME 2025 z 70 do 87,5 procent, ranking Codeforces z 1530 do 1930, SWE-bench Verified z 49,2 do 57,6 procent, a Aider-Polyglot z 53,3 do 71,6 procent. Humanity's Last Exam, najtrudniejszy z testów ogólnych, poprawił się ponad dwukrotnie: z 8,5 do 17,7 procent. Firma nietypowo otwarcie mówi, skąd bierze się ten zysk — i nie jest to nowa architektura. R1-0528 po prostu myśli dłużej. Na zestawie AIME poprzedni model zużywał około 12 tysięcy tokenów na zadanie, ten zużywa średnio 23 tysiące. Poprawę kupiono obliczeniami w fazie douczania i zmianami algorytmicznymi w etapie rozumowania, co czyni z tego wydania czysty, publicznie udokumentowany punkt odniesienia: ile da się wycisnąć z tych samych wag, płacąc tokenami w chwili odpowiedzi. Jedna liczba poszła w drugą stronę i producent opublikował ją mimo to: SimpleQA, mierzący pamięć faktów, spadł z 30,1 do 27,8 procent. Model, który mocniej rozumuje, nie staje się automatycznie modelem, który lepiej pamięta. Wydanie dołożyło też wywoływanie funkcji, wyjście w formacie JSON i obsługę polecenia systemowego — czyli praktyczne braki, przez które pierwszy R1 nie trafiał do wdrożeń — oraz zniosło konieczność rozpoczynania odpowiedzi znacznikiem myślenia. Wagi i repozytorium są na licencji MIT. Maksymalna długość generowanej odpowiedzi w testach producenta wynosiła 64 tysiące tokenów.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!