Wszystkie newsyBadania

Z.ai przypisuje Claude Opus 4.8 dziesięć punktów więcej niż sam Anthropic — w tym samym teście i tej samej wersji, i traci przez to zwycięstwo

Opublikowano: 13.09.2026 · Źródło: Anthropic / Z.ai

Dwaj producenci opublikowali wynik Terminal-Bench 2.1 dla tego samego modelu — Claude Opus 4.8 — w odstępie kilku tygodni. Anthropic w tabeli premierowej tego modelu podaje 74,6%. Z.ai w karcie modelu GLM-5.2 pisze, że jego własny model „w Terminal-Bench 2.1 (81,0) mieści się w kilku punktach od Claude Opus 4.8 (85,0)”. Różnica wynosi 10,4 punktu, a obie liczby prowadzą do przeciwnych wniosków. Czytane w tabeli Z.ai, GLM-5.2 jest pretendentem: 81,0 wobec rywala z wynikiem 85,0 — blisko, ale za nim. Czytane w tabeli Anthropic, to samo 81,0 wyraźnie bije 74,6 Opusa 4.8. Innymi słowy: chińskie laboratorium podało dla konkurenta liczbę, przy której jego własny model z otwartymi wagami wypada gorzej, niż wypadłby przy liczbie ogłoszonej przez samego konkurenta. Żadna z tabel nie jest wprost nieprawdziwa. Terminal-Bench nie ocenia modelu — ocenia model prowadzony przez konkretny szkielet agenta, i oficjalny ranking mówi to wprost: przy każdej pozycji stoi kolumna AGENT obok nazwy modelu. Z.ai mierzyło pod Terminus-2. Tabela Anthropic nie nazywa szkieletu w ogóle, a w tym samym wierszu oddaje pierwsze miejsce GPT-5.5 z wynikiem 78,2%, czyli przed obydwoma. Wniosek jest węższy niż „testom nie można wierzyć”. Brzmi tak: wyniku Terminal-Bench bez podanego szkieletu nie da się zestawić z innym wynikiem Terminal-Bench, nawet przy identycznej wersji testu i nawet gdy obie liczby pochodzą od firm, które mają wszelkie powody mierzyć starannie. W publicznym rankingu ten sam Opus 4.8 uruchomiony pod Claude Code ma 23,6% — w Terminal-Bench 3.0, czyli trzecią liczbę dla modelu, w którym nic się nie zmieniło. Oba profile w katalogu zostały poprawione: wpis Opusa 4.8 odnotowuje wiersz, który przegrywa, a wpis GLM-5.2 nazywa szkielet stojący za wynikiem 81,0.