MDL-2151EST.2025 · IDX.485
Model językowyW produkcji

GLM-4.5V

Z.ai (Zhipu AI) · China · 2025

Pierwszy szeroko używany model wizyjny Z.ai: 106 mld parametrów, które czytają obrazy, wideo, dokumenty i ekrany komputera.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

GLM-4.5V, opublikowany w sierpniu 2025, to model, który dał linii Z.ai oczy. Jest to sieć mixture-of-experts o 106 mld parametrów łącznie i 12 mld aktywnych na token — ten sam szkielet co GLM-4.5-Air, dlatego oba zajmują na dysku niemal dokładnie tyle samo — przetrenowana tak, by przyjmowała w jednym zapytaniu obrazy, wideo, dokumenty i tekst. Cztery zastosowania wymieniane przez Z.ai są zwyczajne, ale wymagające: opisywanie zdjęć i wnioskowanie z nich, rozumienie wideo, rozbiór dokumentów oraz obsługa interfejsów graficznych. To ostatnie okazało się najważniejsze dla kierunku, w którym poszła cała branża: model, który patrzy na zrzut ekranu i wskazuje, w który przycisk kliknąć, to brakująca połowa agenta obsługującego komputer. W dniu premiery firma deklarowała najlepsze wyniki wśród otwartych modeli wizyjno-językowych podobnej wielkości. Przed wyborem warto znać ograniczenia. Okno kontekstu ma 64 tys. tokenów, czyli połowę tego, co modele tekstowe tej samej generacji, a odpowiedź nie przekracza 16 tys. tokenów — to model do czytania, nie do pisania długich raportów. Cennik: 0,60 USD za milion tokenów wejścia i 1,80 USD za milion wyjścia. Wagi leżą na Hugging Face na licencji MIT i pobrano je około 97 tys. razy. Jego następca, GLM-4.6V, ma pliki wag identycznej wielkości — to ta sama sieć, przetrenowana — przy połowie ceny i dwukrotnie większym kontekście, więc dziś GLM-4.5V jest raczej punktem odniesienia niż zakupem.

#open weights#MIT license#vision-language#GUI agents#video understanding
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję