GLM-4V-9B
Z.ai (Zhipu AI) · China · 2024
Pierwszy otwartowagowy model wizyjny Z.ai: czyta obrazy 1120x1120, a jego najmocniejszym wynikiem jest rozpoznawanie tekstu, nie ogólne rozumowanie.
GLM-4V-9B to wizyjny wariant generacji GLM-4, opublikowany 4 czerwca 2024 roku razem z tekstowym GLM-4-9B-Chat. To model, od którego zaczęła się linia wizyjna producenta, biegnąca dziś przez GLM-4.1V-9B-Thinking do GLM-4.6V. Prowadzi wieloturową rozmowę po chińsku i angielsku o obrazach w rozdzielczości 1120x1120 pikseli. Jedną liczbę z nazwy trzeba sprostować, zanim ktoś zaplanuje pod nią sprzęt. Opublikowane wagi mają 13,9 mld parametrów, nie dziewięć: wieżą tekstową jest dziewięciomiliardowy GLM-4 o 40 warstwach, wymiarze ukrytym 4096 i 32 głowicach uwagi na 2 głowice klucz-wartość, a na niej siedzi osobny koder obrazu o 63 warstwach i wymiarze 1792, którego nazwa nie liczy. Okno kontekstu to 8192 tokeny — najkrótsze w całym sąsiedztwie tego profilu. Karta modelu twierdzi, że model wygrywa z GPT-4-turbo z kwietnia 2024, Gemini 1.0 Pro, Qwen-VL-Max i Claude 3 Opus, i tabela pod tym zdaniem to potwierdza. Ta sama tabela pokazuje jednak, że GPT-4o z maja 2024 wyprzedza go niemal w każdej kolumnie — 69,2 do 47,2 w akademickim zestawie MMMU i 63,9 do 58,7 w MMStar. Czytana kolumna po kolumnie, uczciwa wersja jest węższa i bardziej użyteczna: to model, który jak na swój rozmiar wyjątkowo dobrze czyta tekst ze zdjęć. Jego 786 punktów w teście OCRBench to najwyższy wynik w całym zestawieniu producenta, powyżej 736 punktów GPT-4o — a w wiedzy przedmiotowej model zostaje o pokolenie z tyłu. Licencja to dokument GLM-4, nie licencja otwartego oprogramowania: prace pochodne muszą nieść notę „Built with glm-4”, a ich nazwa musi zaczynać się od „glm-4”.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!