MDL-7919EST.2026 · IDX.898
Model językowyW produkcji

GLM-5V-Turbo

Z.ai (Zhipu AI) · China · 2026

Pierwszy multimodalny model kodujący Z.ai: patrzy na zrzut ekranu, makietę albo żywą stronę i pisze do niej kod.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

GLM-5V-Turbo, wydany na początku kwietnia 2026, to model, którym Z.ai połączyło widzenie z programowaniem. Tam gdzie tekstowe modele rodziny GLM-5 czytają specyfikacje, ten czyta obrazy: makiety projektowe, szkice, zrzuty popsutych stron, wideo, całe dokumenty. Na wyjściu zawsze jest tekst — w praktyce kod. Zastosowania opisane przez producenta mówią o modelu więcej niż tabela wyników. Z makiety odtwarza układ, paletę, hierarchię komponentów i logikę interakcji, oddając gotowy do uruchomienia projekt front-endu. Ze zrzutu źle wyrenderowanej strony rozpoznaje nachodzące na siebie komponenty, rozjechany układ i niezgodne kolory, po czym proponuje poprawkę. W trybie agentowym idzie dalej i sam przegląda docelowy serwis, mapuje przejścia między podstronami i zbiera materiały wizualne — Z.ai nazywa to krokiem od „odtwarzania ze zrzutu ekranu” do „odtwarzania przez samodzielną eksplorację”. Ta sama percepcja pozwala mu obsługiwać interfejsy graficzne, co firma mierzy testami AndroidWorld i WebVoyager. Technicznie przyjmuje wideo, obrazy, tekst i pliki, mieści 200 tys. tokenów kontekstu i zwraca do 128 tys., z trybami myślenia, strumieniowaniem, wywoływaniem funkcji i buforowaniem kontekstu. Producent opisuje enkoder wizyjny CogViT, architekturę z przewidywaniem wielu tokenów naraz oraz uczenie ze wzmocnieniem prowadzone równolegle na ponad trzydziestu rodzajach zadań. Cena to 1,20 USD za milion tokenów wejścia i 4,00 USD za milion wyjścia — ta sama półka co tekstowy GLM-5-Turbo. Dwa braki warto nazwać wprost. Z.ai nie podaje liczby parametrów, a w odróżnieniu od linii tekstowej nie udostępniło wag: GLM-5V-Turbo działa wyłącznie przez API, więc zwykłe sprawdzenie w indeksie plików safetensors tutaj odpada. Firma wielokrotnie podkreśla, że model osiąga swoje wyniki „przy mniejszym rozmiarze” — i akurat tego, wobec braku liczby, nie da się zweryfikować.

#vision-language#multimodal coding#GUI agents#API only#200K context
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję