MDL-5591EST.2025 · IDX.532
Model językowyW produkcji

Cohere Command A Vision

Cohere · Canada · 2025

Pierwszy model Cohere, który potrafi patrzeć — do 20 obrazów na zapytanie, wycelowany w wykresy, tabele i zeskanowane dokumenty, a nie w sztukę.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Command A Vision, opublikowany 31 lipca 2025 roku, był pierwszym modelem Cohere zdolnym czytać obrazy. Jego zadanie jest wąskie i celowo nieefektowne: wykresy, diagramy, tabele, rozpoznawanie tekstu z obrazu, odpowiadanie na pytania o dokument i wykrywanie obiektów. To praca wzrokowa, która dzieje się wewnątrz wniosku ubezpieczeniowego albo raportu kwartalnego, a nie generowanie obrazów czy ich twórcza interpretacja. Model przyjmuje do 20 obrazów w jednym zapytaniu, co ma znaczenie przy obiegu dokumentów, gdzie pojedyncza sprawa to plik zeskanowanych stron, a nie jedna fotografia. Okno kontekstu wynosi 128 tysięcy tokenów przy 8 tysiącach tokenów wyjścia, a oficjalnie obsługiwane języki to angielski, portugalski, włoski, francuski, niemiecki i hiszpański — lista krótsza niż 23 języki tekstowego rodzeństwa, o czym warto pamiętać, zanim założy się, że cała rodzina Command A zachowuje się tak samo. Konstrukcyjnie to Command A z dodanym wzrokiem: 111,87 miliarda parametrów wobec 111,06 miliarda w modelu tekstowym, czyli około 810 milionów parametrów wieży wizyjnej dołożonej na wierzch. Cohere zachował ten sam interfejs API co reszta linii Command, więc dodanie wejścia obrazowego do istniejącej integracji to zmiana nazwy modelu, a nie przepisywanie kodu. Wagi są na Hugging Face na licencji CC BY-NC 4.0 — badania i wgląd są dozwolone, wdrożenie komercyjne nie.

#Cohere#Command#vision#OCR#CC BY-NC 4.0
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję