Rozumujący model, od którego zaczęła się linia wizyjna Z.ai: dziewięć miliardów parametrów, które dorównały rywalowi o siedemdziesięciu dwóch na osiemnastu z dwudziestu ośmiu testów.
GLM-4.1V-9B-Thinking to model, który zamienił prace Z.ai nad widzeniem w linię rozumującą. Zbudowano go na własnym modelu tekstowym firmy GLM-4-9B-0414, rozszerzonym o koder obrazu i douczonym uczeniem ze wzmocnieniem tak, by rozumował krok po kroku przed udzieleniem odpowiedzi — ten sam sposób myślenia firma przeniosła później do GLM-4.5V i GLM-4.6V.
Główna teza dotyczy rozmiaru. Z.ai podaje, że na 28 testach model był najlepszy w klasie około dziesięciu miliardów parametrów w 23 z nich, a w 18 pokonał Qwen2.5-VL-72B od Alibaby, czyli model osiem razy większy. To pomiar samego wydawcy, ale liczba pobrań pokazuje, że rynek potraktował go poważnie: to wciąż jeden z najczęściej pobieranych modeli w dorobku tej firmy.
Jedna liczba wymaga przypisu. Nazwa mówi o dziewięciu miliardach i tekstowa połowa modelu rzeczywiście jest dziewięciomiliardowym GLM-4; opublikowany plik wag liczy jednak 10,3 miliarda parametrów, bo doliczony jest do niego koder obrazu. Kto dobiera sprzęt, powinien liczyć według tej większej wartości.
Model czyta obrazy o dowolnych proporcjach i rozdzielczości do 4K, obsługuje wideo, pracuje po chińsku i angielsku oraz utrzymuje okno kontekstu 64 tysięcy tokenów. Wagi wydano na licencji MIT, a razem z nimi opublikowano model bazowy bez treningu rozumowania.
#vision language#reasoning#open weights#small model