MDL-2771EST.2025 · IDX.943
Model językowyW produkcji

IBM Granite Docling 258M

IBM · USA · 2025

Model o 258 milionach parametrów, który czyta zeskanowaną stronę i odtwarza ją: tabele, wzory i bloki kodu wracają jako struktura, a wierność tabel sięga 0,97 wobec 0,82 u modelu, którego zastąpił.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Granite Docling 258M wykonuje jedno zadanie: patrzy na obraz strony dokumentu i spisuje, co na niej jest — nie prozą, tylko w zapisie DocTags, który notuje położenie każdego elementu i jego rodzaj. Tabela wraca jako tabela z nietkniętymi komórkami, wzór jako wzór, listing kodu jako kod z zachowanymi wcięciami. Ten wynik trafia wprost do otwartego zestawu narzędzi Docling, który zamienia go w Markdown, HTML albo JSON. To mniej efektowna połowa przetwarzania dokumentów i używa się jej znacznie intensywniej niż modeli z pierwszych stron. Repozytorium pobrano około 239 tysięcy razy w trzydziestu dniach do 1 września 2026 roku — ponad dwa razy częściej niż Granite Vision 4.1 4B, obecny model obrazowy ogólnego przeznaczenia tej firmy, i częściej niż strażnika treści Granite Guardian. Każdy, kto buduje wyszukiwanie po plikach PDF, musi najpierw rozwiązać konwersję strony, zanim cokolwiek innego zadziała, a model o 258 milionach parametrów mieści się na laptopie. Architektura to niewielki montaż z pożyczonych części: układ Idefics3, w którym koder obrazu wymieniono na SigLIP2 base przy 512 pikselach, a połowę językową na model Granite o 165 milionach parametrów. To produkcyjny następca zapowiedzi SmolDocling-256M, a tabele producenta pokazują, gdzie przybyło. Rozpoznawanie struktury tabel w zbiorze FinTabNet rośnie z 0,82 na 0,97, a treści tabel z 0,76 na 0,96 — to różnica między tabelą do przepisania ręcznie a tabelą gotową do użycia. Rozpoznawanie kodu poprawia się niemal o rząd wielkości: odległość edycyjna spada z 0,114 na 0,013. Rozpoznawanie wzorów, wykrywanie układu strony i pełnostronicowe OCR poprawiają się skromniej, a wynik OCRBench rośnie z 338 na 500. Model przyjmuje też polecenia ograniczone do fragmentu: zamiast konwertować całą stronę, można wskazać mu jeden prostokąt, a także zapytać o strukturę dokumentu — jakie elementy w nim występują i w jakiej kolejności. IBM wymienia również większą odporność na pętle powtórzeń, które trapiły wersję zapowiadaną. Ograniczenia warte odnotowania: model jest angielski, a japoński, arabski i chiński karta modelu oznacza jako eksperymentalne — o polskim nie ma mowy. Licencja to czysta Apache 2.0, bez wyłączeń terytorialnych i bez aneksu o dopuszczalnym użyciu, więc wagi wolno wykorzystywać komercyjnie i bez sieci. Akurat tutaj to istotne: umowy, faktury i dokumentacja medyczna to materiał, który nie powinien opuszczać budynku.

#open-weights#apache-2.0#IBM#document-ai#ocr
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję