GLM-OCR
Z.ai (Zhipu AI) · China · 2026
Czytnik dokumentów o 0,9 mld parametrów, pobierany częściej niż wszystkie pozostałe modele Z.ai razem wzięte.
GLM-OCR to najmniejszy model w ofercie Z.ai i — z ogromną przewagą — najczęściej używany. Czyta zeskanowane dokumenty, zdjęcia i pliki PDF, a zwraca tekst, tabele w HTML, ustrukturyzowany JSON albo Markdown. Producent podaje 0,9 mld parametrów; pliki wag na Hugging Face sumują się do 1,33 mld, a różnicę tworzy enkoder wizyjny, którego liczba z komunikatu nie obejmuje. Cała rzecz polega właśnie na rozmiarze. Tak mały model działa na skromnym sprzęcie, wdraża się przez vLLM albo SGLang i odpowiada na tyle szybko, że mieści się wewnątrz potoku przetwarzania dokumentów, a nie za nim. Z.ai raportuje 94,62 punktu w teście OmniDocBench V1.5, w dniu premiery wynik czołowy, i osobno wymienia przypadki, na których zwykłe OCR-y się wykładają: listingi kodu, gęste tabele, pieczęcie, mieszankę tekstu z obrazem, nietypowe kroje pisma. Ograniczenia są proste — pojedynczy obraz do 10 MB, PDF do 50 MB, najwyżej 100 stron na zapytanie — a obsługiwane języki obejmują chiński, angielski, francuski, hiszpański, rosyjski, niemiecki, japoński i koreański. Cena wynosi 0,03 USD za milion tokenów w obie strony: to najtańsza pozycja w całym cenniku Z.ai i setna część tego, co kosztuje czytanie tekstu przez własnego flagowca firmy. Najwięcej mówi licznik pobrań: około 2,85 mln pobrań z Hugging Face wobec 115 tys. przy flagowym GLM-4.5 i 172 tys. przy jego lżejszej odmianie. Zamiana papieru na ustrukturyzowany tekst to zadanie, które ma każda organizacja, a darmowy model na licencji MIT, radzący sobie z nim na jednej zwykłej karcie graficznej, zajedzie znacznie dalej niż maszyna do rozumowania o 355 mld parametrów.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!