MDL-2800EST.2026 · IDX.018
ObrazW produkcji

Tencent HunyuanOCR 1.5

Tencent · China · 2026

Model wizyjno-językowy o 1,1 miliarda parametrów zbudowany wyłącznie do czytania dokumentów: analiza układu, wykrywanie tekstu, wyciąganie danych i tłumaczenie obrazu w jednym przebiegu, na tyle mały, że działa na laptopie.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

HunyuanOCR 1.5 to wyspecjalizowany model Tencenta do czytania dokumentów: zamiast typowego łańcucha złożonego z detektora tekstu, modułu rozpoznającego i osobnego silnika układu strony, całością zajmuje się jeden model wizyjno-językowy o zaledwie 1,12 miliarda parametrów. Obsługuje analizę dokumentu, wykrywanie tekstu na zdjęciu, wyciąganie danych i tłumaczenie tekstu z obrazu. Wynik jest od razu ustrukturyzowany: treść w Markdownie, tabele w HTML-u, wzory w LaTeX-u, więc model zastępuje cały zestaw narzędzi, a nie jedno ogniwo. Enkoder obrazu przyjmuje pliki do rozdzielczości 4K, a część językowa ma okno kontekstu 131 072 tokenów i to właśnie pozwala przerobić długi, gęsty dokument w jednym przebiegu. Wydanie 1.5 z 6 lipca 2026 świadomie nie ruszyło architektury odziedziczonej po wersji 1.0. Tencent poświęcił tę generację dwóm sprawom. Pierwsza to szybkość: mechanizm DFlash uruchamia lekki model pomocniczy, który proponuje kilka tokenów naraz, a model główny weryfikuje je jednym przebiegiem. To odpowiedź na rzeczywiste wąskie gardło takich modeli, bo gęsta tabela albo strona wzorów oznacza bardzo długie generowanie. Druga to zasięg sprzętowy: model działa teraz na procesorze, konsumenckiej karcie graficznej i na laptopie dzięki obsłudze llama.cpp i formatowi GGUF, więc przetwarzanie dokumentów przestało wymagać sprzętu serwerowego. Trening przebudowano wokół tego, co firma nazywa Agentic Data Flow — potoku danych prowadzonego przez agenty i wymierzonego w rzadkie umiejętności: języki o ubogich zasobach, pisma historyczne i pytania obejmujące kilka obrazów naraz. Jedno zastrzeżenie jest istotne dla czytelnika w Europie. Mimo otwartych wag na Hugging Face model nie jest rozpowszechniany na licencji wolnej: umowa Tencent Hunyuan Community zaczyna się zdaniem pisanym wielkimi literami, że nie obowiązuje w Unii Europejskiej, Wielkiej Brytanii i Korei Południowej. Firma z tych terytoriów nie dostaje więc warunków restrykcyjnych, tylko żadnych. To dokładnie ten zapis, który Tencent usunął w linii flagowej Hy4, przenosząc ją na czystą licencję Apache 2.0; model OCR nadal go ma.

#OCR#vision-language#open weights#document parsing#China#on-device
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję