MDL-6918EST.2026 · IDX.806
Model językowyW produkcji

North Micro Vision Instruct

Cohere · Canada · 2026

Najmniejszy model wizyjno-językowy Cohere: 2,4 miliarda parametrów na licencji Apache 2.0, zbudowany do czytania całej strony A4 w jej własnej rozdzielczości, a nie pomniejszonej kopii.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

North Micro Vision Instruct to najmniejszy model wizyjno-językowy, jaki opublikowało Cohere. Wydano go 12 sierpnia 2026 r. na licencji Apache 2.0, bez żadnych warunków dotyczących użytku komercyjnego. Ma łącznie 2,4 miliarda parametrów: własny model językowy o 2 miliardach parametrów w parze z koderem obrazu o 400 milionach, wytrenowanym na bazie SigLIP 2 SO400M od Google'a. Celem konstrukcji są dokumenty. Większość małych modeli wizyjnych sprowadza obraz do stałego kwadratu, zanim w ogóle na niego spojrzy, co jest zabójcze dla drobnego druku; ten przyjmuje rozdzielczość natywną do 1654 × 2339 pikseli — czyli stronę A4 zeskanowaną w 200 dpi — i zachowuje proporcje. Strukturę przestrzenną utrzymuje połączenie dwuwymiarowych osadzeń obrotowych z wyuczonymi pozycjami jednowymiarowymi, a fragmenty obrazu wstrzykiwane są do kilku warstw modelu językowego, nie tylko do pierwszej. Rdzeń językowy przeplata trzy warstwy uwagi w oknie przesuwnym jedną warstwą uwagi globalnej — i to właśnie pozwala na okno 128 000 tokenów bez kosztu pamięci, jaki poniósłby model tej wielkości oparty wyłącznie na uwadze globalnej. Cohere nietypowo szczerze opisuje granicę tej liczby: zweryfikowany zakres pracy dla zapytań zawierających obrazy wynosi 8000 tokenów, a wszystko powyżej opiera się na ekstrapolacji, której firma nie przebadała. Zadeklarowano jedenaście języków, od angielskiego po arabski; polskiego wśród nich nie ma. Własne pomiary Cohere stawiają model na czele jego klasy wielkości w pracy z dokumentami — 0,921 na DocVQA, 0,808 na ChartQA, 0,775 na AI2D i średnio 0,732 na wskazywaniu obiektów RefCOCO — przy jawnym przyznaniu strat gdzie indziej: 0,687 na MMBench wobec 0,731 dla większego Phi-3.5-vision oraz 0,725 na CountBench wobec 0,764 dla SmolVLM. To liczby producenta. Trening przebiegł w czterech etapach, od 10 milionów przykładów w stałej rozdzielczości po dostrajanie instrukcyjne na 50 milionach i końcowe dostrojenie preferencji na 500 tysiącach. Model pojawił się w tym samym tygodniu co LFM2.5-VL-3B od Liquid AI, konstrukcja podobnej wielkości celująca w tę samą niszę pracy na urządzeniu. Różnica techniczna dotyczy akcentu — Cohere optymalizuje czytanie strony, Liquid AI szybkie czytanie ekranu — ale różnica licencyjna jest ostrzejsza: tu Apache 2.0, tam licencja z pułapem przychodu.

#open weights#multimodal#vision-language#document OCR#local deployment#Canada
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję