MDL-2970EST.2025 · IDX.800
Model językowyW produkcji

GLM-4.1V-9B-Thinking

Z.ai (Zhipu AI) · China · 2025

Rozumujący model, od którego zaczęła się linia wizyjna Z.ai: dziewięć miliardów parametrów, które dorównały rywalowi o siedemdziesięciu dwóch na osiemnastu z dwudziestu ośmiu testów.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

GLM-4.1V-9B-Thinking to model, który zamienił prace Z.ai nad widzeniem w linię rozumującą. Zbudowano go na własnym modelu tekstowym firmy GLM-4-9B-0414, rozszerzonym o koder obrazu i douczonym uczeniem ze wzmocnieniem tak, by rozumował krok po kroku przed udzieleniem odpowiedzi — ten sam sposób myślenia firma przeniosła później do GLM-4.5V i GLM-4.6V. Główna teza dotyczy rozmiaru. Z.ai podaje, że na 28 testach model był najlepszy w klasie około dziesięciu miliardów parametrów w 23 z nich, a w 18 pokonał Qwen2.5-VL-72B od Alibaby, czyli model osiem razy większy. To pomiar samego wydawcy, ale liczba pobrań pokazuje, że rynek potraktował go poważnie: to wciąż jeden z najczęściej pobieranych modeli w dorobku tej firmy. Jedna liczba wymaga przypisu. Nazwa mówi o dziewięciu miliardach i tekstowa połowa modelu rzeczywiście jest dziewięciomiliardowym GLM-4; opublikowany plik wag liczy jednak 10,3 miliarda parametrów, bo doliczony jest do niego koder obrazu. Kto dobiera sprzęt, powinien liczyć według tej większej wartości. Model czyta obrazy o dowolnych proporcjach i rozdzielczości do 4K, obsługuje wideo, pracuje po chińsku i angielsku oraz utrzymuje okno kontekstu 64 tysięcy tokenów. Wagi wydano na licencji MIT, a razem z nimi opublikowano model bazowy bez treningu rozumowania.

#vision language#reasoning#open weights#small model
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję