DeepSeek-OCR-2
DeepSeek · China · 2026
Druga generacja modelu dokumentowego DeepSeeka: model wizyjno-językowy o 3,4 miliarda parametrów, który zamienia strony w Markdown, z otwartymi wagami na licencji Apache 2.0.
DeepSeek-OCR-2 to niewielki model wizyjno-językowy zbudowany do jednego zadania: czytania dokumentów. Ze zdjęcia strony zwraca czysty tekst albo transkrypt w Markdownie z zachowaniem układu, a w trybie z zakotwiczeniem wiąże rozpoznany tekst z miejscami na stronie. Wagi opublikowano na Hugging Face 27 stycznia 2026, ostatnia poprawka pochodzi z 3 lutego 2026; towarzysząca im praca „DeepSeek-OCR 2: Visual Causal Flow" trafiła na arXiv dzień po premierze (2601.20552). Jak na linię modeli DeepSeeka jest to konstrukcja mała: około 3,39 miliarda parametrów wobec 685 miliardów w DeepSeek-V3.2 i 1,6 biliona we flagowym V4-Pro. Architektura łączy wieżę wizyjną DeepEncoder drugiej generacji z dwunastowarstwowym dekoderem w stylu DeepSeek-V2 z mieszanką ekspertów — 64 eksperty kierowane plus dwa współdzielone, sześć aktywnych na token — oraz kontekstem językowym 8192 tokenów. Obraz kodowany jest w zmiennej rozdzielczości: do sześciu kafelków 768×768 plus jeden widok globalny 1024×1024, co kosztuje maksymalnie 6×144 plus 256 tokenów wizyjnych. Całość mieści się w bfloat16 na jednej karcie graficznej, pod Transformers z włączonym kodem zdalnym albo pod vLLM do hurtowej obróbki PDF-ów. Najciekawsza jest licencja. Pierwszy DeepSeek-OCR, opublikowany 17 października 2025 jako „Contexts Optical Compression", ma licencję MIT jak reszta dorobku firmy; druga generacja wychodzi na Apache 2.0 — co sprawdziliśmy w pliku LICENSE.txt w repozytorium, a nie tylko w etykiecie karty modelu. Oba modele zostają do pobrania i oba są intensywnie używane: w odczycie z 25 sierpnia 2026 pierwsza generacja notuje 2,37 miliona pobrań w trzydzieści dni, druga 1,27 miliona, czyli razem więcej niż aktualne wydanie flagowca DeepSeeka. Firma nie sprzedaje żadnego z nich we własnym API — jedyną drogą jest uruchomienie wag u siebie.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!