GLM-5.2 stracił siedem punktów w teście programowania, choć nie zmieniono w nim ani jednej wagi. Ten test ocenia na krzywej
Opublikowano: 13.09.2026 · Źródło: FrontierSWE V1 leaderboard (Proximal); Z.ai — GLM-5.2 model card and GLM-5.3 launch post ↗
Z.ai publikuje ten sam benchmark dwa razy i podaje dwie różne liczby. Karta modelu GLM-5.2, wydana razem z modelem w czerwcu, podaje we FrontierSWE 74,4 wobec 75,1 dla Claude Opus 4.8 i 72,6 dla GPT-5.5 — firma pisała wtedy, że jej model przegrywa z Opusem 4.8 o mniej więcej punkt. Tabela porównawcza w komunikacie o GLM-5.3, opublikowanym dwa miesiące później, daje GLM-5.2 w tym samym teście 67,5 wobec 66,5 dla Opusa 4.8. Model się nie zmienił. Zmieniła się kolejność: teraz to GLM-5.2 jest z przodu.
Wyjaśnienie leży w sposobie liczenia i FrontierSWE pisze o tym wprost na swojej tablicy wyników. Główna liczba nie jest odsetkiem zdanych zadań. To dominacja, czyli odsetek wygranych z losowym przeciwnikiem na losowym zadaniu, liczony na siedemnastu zadaniach. Taki wynik względny jest przeliczany wszystkim od nowa za każdym razem, gdy na listę wchodzi kolejny konkurent. Między czerwcem a sierpniem doszły GLM-5.3, Grok 4.6, Kimi K2.6 i inne; GLM-5.2 spadł z 74,4 do 67, Opus 4.8 z 75,1 do 67, a że Opus stracił więcej, oba zamieniły się miejscami. Żaden z wyników nie jest błędny i żadna z firm niczego nie przekręciła. Przypis na karcie Z.ai jest w tej sprawie uczciwy: podaje wynik na dzień 16 czerwca 2026.
Reszta dzisiejszej tablicy V1 wygląda tak samo, w pełnych procentach: Claude Fable 5 — 88, GLM-5.3 i Grok 4.6 — 78, Grok 4.5 — 72, dalej GLM-5.2 i Opus 4.8 po 67 oraz GPT-5.5 z 65. Warto wiedzieć, na czym te procenty stoją. Na pięciu zadaniach wdrożeniowych z wersji V1 żaden model nie ukończył żadnego zadania w żadnej próbie, więc ranking opiera się tam na odsetku testów zaliczonych przez najlepszą z pięciu prób.
FrontierSWE przeszedł tymczasem na wersję V2 i zszedł z krzywej: 34 zadania, po pięć prób na każde, dwadzieścia godzin budżetu na próbę i wynik bezwzględny. Na tej tablicy prowadzi Claude Fable 5.1 z wynikiem 56,3 procent plus minus 11,1, przy średnio 138,55 dolara i 11,6 godziny na zadanie, drugi jest GPT-5.6 z 32,2. Ta sama nazwa, trzy różne rzeczy, które czytelnik może mieć na myśli. Nasz profil GLM-5.2 podaje teraz obie liczby razem z datą i sposobem pomiaru — bo tylko w takiej formie wynik względny cokolwiek znaczy.