Badania13.09.2026 · Z.ai — GLM-5.3 model guideZ.ai mierzy swój model wobec rywala w dwie godziny — tyle że te dwie godziny liczy każdemu osobno
Najuczciwsze zdanie w komunikacie Z.ai o modelu GLM-5.3 jest zarazem tym, które utrudnia odczytanie firmowej liczby z nagłówka: w teście ExploitGym budżet czasu jest normalizowany osobno dla każdego modelu, według przepustowości podanej dopiero w przypisach. Porównanie brzmi „105 zadań w dwie godziny wobec 181" — tyle że te dwie godziny nie są dla wszystkich tymi samymi dwiema godzinami.
ExploitGym liczy, ile zadań z wykorzystania podatności model wykona w zadanym czasie. Z.ai podaje dla GLM-5.3 105 zadań w dwie godziny i 130 w sześć, wobec 29 i 39 u poprzednika. W tym wierszu stoi tylko jeden model zamknięty: Mythos 5, ze 181 i 247 zadaniami. Test rozliczany zegarem mierzy naraz dwie rzeczy — jak dobrze model rozumuje i jak szybko jest serwowany — więc normalizacja budżetu jest zabiegiem uzasadnionym. Oznacza jednak, że dystans z nagłówka zależy od założenia o przepustowości, którego czytelnik nie widzi.
W tym samym komunikacie stoją dwa dalsze zastrzeżenia, oba postawione przez samo Z.ai i oba regularnie gubione, gdy liczby ruszają w świat. Rekord w testach Terminal-Bench 3.0 i Agents' Last Exam jest wyraźnie rekordem wśród modeli z otwartymi wagami, a nie w całej stawce. A na wewnętrznym teście Z.ai Code Bench GLM-5.3 osiąga przy maksymalnym wysiłku 34,5% — wyprzedza Claude Opus 4.8 przy ustawieniu wysokim, ale zostaje za Claude Fable 5 z wynikiem 39,5%. Podsumowanie na początku strony wymienia pierwsze porównanie i pomija drugie.
Nic z tego nie umniejsza wyniku w bezpieczeństwie. GLM-5.3 rośnie w teście CyberGym z 77,2% do 84,5%, co jest najlepszą liczbą w tabeli producenta, a Z.ai podaje, że model znalazł 2436 podatności w 269 realnych projektach, w tym 1097 o średniej i wysokiej istotności. Najbardziej użyteczny jest przy tym własny wniosek firmy: zdolności rosną najszybciej dokładnie tam, gdzie dystans do zamkniętej czołówki jest największy. Nasz profil GLM-5.3 został poprawiony — wcześniejsza wersja przypisywała wyniki 181 i 247 dwóm różnym modelom zamkniętym, podczas gdy oba należą do jednego, przy dwóch różnych budżetach czasu.
GLM-5.3 →