MDL-2795EST.2025 · IDX.013
ObrazW produkcji

Tencent HunyuanOCR 1.0

Tencent · China · 2025

Pierwszy model Tencenta zbudowany wyłącznie do OCR: system o miliardzie parametrów, który zastąpił klasyczny łańcuch detektora i modułu rozpoznającego jednym modelem działającym w całości od obrazu do wyniku.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

HunyuanOCR 1.0 był wejściem Tencenta w wyspecjalizowane czytanie dokumentów; firma opublikowała go 25 listopada 2025. Założenie brzmiało tak: tradycyjny zestaw narzędzi OCR — detektor tekstu, osobny moduł rozpoznający, do tego silnik układu strony i reguły przetwarzania końcowego — da się zwinąć do jednego modelu wizyjno-językowego na tyle małego, by był praktyczny. Efekt waży około miliarda parametrów (mniej więcej 2 GB wag w formacie bf16) i z jednego polecenia obsługuje analizę dokumentu, wykrywanie tekstu na zdjęciu, wyciąganie danych oraz tłumaczenie tekstu z obrazu, zwracając treść w Markdownie, tabele w HTML-u, a wzory w LaTeX-u. Architektura to enkoder obrazu podający dane do 24-warstwowego dekodera tekstu o wymiarze ukrytym 1024 i 16 głowicach uwagi. Dwa ograniczenia znamionują starszą generację: okno kontekstu kończy się na 32 768 tokenach, a enkoder przyjmuje najwyżej 4096 tokenów obrazu na zdjęcie. Dokładnie te dwie granice zniosło wydanie 1.5 z lipca 2026 — do 131 072 tokenów i 16 384 tokenów obrazu — i właśnie dlatego słabym punktem tej wersji były gęste, wielostronicowe dokumenty, a nie sama dokładność odczytu. Tencent nie wycofał modelu, gdy pojawił się następca. Wersja 1.0 została w tym samym repozytorium na Hugging Face, w podkatalogu v1.0, i nadal daje się wczytać na żądanie, więc wdrożenia oparte na niej nie przestały działać po aktualizacji. Licencja jest ta sama i ma znaczenie w Europie: umowa Tencent Hunyuan Community stwierdza wielkimi literami, że nie obowiązuje w Unii Europejskiej, Wielkiej Brytanii ani Korei Południowej, więc otwarte wagi nie przekładają się na możliwą do użycia licencję dla podmiotów stamtąd.

#OCR#vision-language#open weights#document parsing#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję