Wszystkie newsyBadania

Alibaba daje rywalom lepszy z dwóch wariantów polecenia, a sobie zostawia jeden — i przegrywa ten wiersz z własnym poprzednikiem

Opublikowano: 13.09.2026 · Źródło: Qwen3.8-27B model card, Hugging Face

Tabele wyników publikowane przez producentów modeli prawie zawsze przechylają się na korzyść producenta. Karta modelu Qwen3.8-27B, otwartej premiery Alibaby z 14 sierpnia 2026 r., zawiera przypis, który przechyla się w drugą stronę — a wiersz, którego dotyczy, firma i tak przegrywa. Chodzi o MathVision, test rozwiązywania zadań matematycznych z obrazkiem. Przypis mówi wprost: Qwen3.8-27B oceniono jednym stałym poleceniem, a dla pozostałych modeli podano lepszy wynik z dwóch wariantów polecenia — jednego wymuszającego format odpowiedzi i jednego bez tego wymogu. Dobór polecenia bywa w takich testach wart realnych punktów, a producent oddaje tu tę przewagę wszystkim poza sobą. Wynik: 90,0 dla Qwen3.8-27B wobec 90,3 dla Qwen3.7-Plus, czyli zamkniętego flagowca poprzedniej generacji tej samej firmy, wytłuszczonego w tabeli jako zwycięzca wiersza. Kilka bloków wyżej ta sama tabela przechyla się już klasycznie. W sekcji programistycznej wszystkie modele porównawcze Alibaba przeliczyła sama, we własnym przebiegu w narzędziu Claude Code, przy ustalonej temperaturze i oknie 256 tys. tokenów, a zestaw zadań SWE-bench Pro przed tymi przebiegami poprawiono. Jedna kolumna jest z tego wyjęta: Opus 4.6 Max zachowuje swój oficjalny wynik 53,4. Nagłówkowe porównanie programistyczne — 61,7 wobec 53,4 — zestawia więc własny przebieg producenta z liczbą policzoną przez kogoś innego, na zestawie zadań, który producent zmodyfikował. To również stoi w przypisie i to jest ta asymetria, która zwykle działa na korzyść wydawcy. Warto przeczytać z tego samego powodu dwa dalsze wiersze. Humanity's Last Exam, w którym odpowiedzi ocenia cudzy model GPT-4o, daje 30,8 nowemu modelowi i 34,7 dla Qwen3.7-Plus; GPQA Diamond — 89,2 wobec 90,3. Wzór pod wszystkimi trzema porażkami jest spójny i nie zaskakuje: gęsty model o 27,78 miliarda parametrów, który każdy może pobrać, bije zamkniętego flagowca chmurowego w pracy, którą da się wykonać i sprawdzić, a przegrywa wszędzie tam, gdzie zadaniem jest pamięć. Nic z tego nie umniejsza premiery. Sprawia tylko, że przypisy są tu nośne. Nasze profile Qwen3.8-27B i Qwen3.6-27B zostały dziś uzupełnione o te zastrzeżenia.