Wszystkie newsyBadania

Nowy otwarty model spisujący mowę bije Whispera — dopóki nie wyjdziesz poza duże języki

Opublikowano: 5.09.2026 · Źródło: Qwen3-ASR model card, Hugging Face

Qwen3-ASR Alibaby jest odczytywany jako model, który wreszcie zrzuca z tronu Whisper-large-v3 — spisujący mowę model OpenAI, który od 2023 roku był domyślnym wyborem wśród rozwiązań otwartych. W nagłówkowych liczbach rzeczywiście tak jest: 4,90 procent błędnych słów wobec 5,27 na zbiorze Fleurs. Tyle że w tabeli wyników producenta stoją obok siebie trzy wiersze nazwane Fleurs, Fleurs† i Fleurs††, a to nie są trzy różne testy — to ten sam test przeprowadzony na 12, 20 i 30 językach. Który wiersz się zacytuje, ten wyznacza zwycięzcę. Na dwunastu największych językach — angielskim, chińskim, kantońskim, arabskim, niemieckim, hiszpańskim, francuskim, włoskim, japońskim, koreańskim, portugalskim i rosyjskim — nowy model wygrywa, 4,90 do 5,27. Po dołożeniu ośmiu kolejnych, w tym polskiego, niderlandzkiego, hindi, tureckiego i wietnamskiego, przewaga kurczy się do remisu: 6,62 do 6,85. A po dołożeniu ostatnich dziesięciu — czeskiego, duńskiego, greckiego, perskiego, fińskiego, filipińskiego, węgierskiego, macedońskiego, rumuńskiego i szwedzkiego — kolejność odwraca się z hukiem: 12,60 wobec 8,16 u Whispera. Ze średnich da się oszacować samą ostatnią grupę. Przy założeniu, że każdy język waży tyle samo, na dziesięciu najmniejszych wychodzi około 25 procent błędów u nowego modelu wobec mniej więcej 11 u trzyletniego — co czwarte słowo wobec co dziewiątego. To różnica między transkrypcją, którą człowiek poprawia, a transkrypcją, którą człowiek przepisuje od nowa. Nic z tego nie umniejsza premiery w pozostałych wymiarach: ten sam model obsługuje transkrypcję na żywo i wsadową, obejmuje 22 chińskie dialekty, spisuje śpiew i piosenki z podkładem, pewniej niż Whisper rozpoznaje sam język nagrania (97,9 wobec 94,1 procent) i wychodzi na licencji Apache 2.0. Wniosek jest węższy i akurat taki, jakiego czytelnik potrzebuje: deklaracja czołowego wyniku w rozpoznawaniu mowy sięga dokładnie tak daleko, jak lista języków pod spodem, a ta lista jest zwykle przypisem. Kto pracuje w czeskim, węgierskim, rumuńskim albo językach nordyckich, powinien przetestować stary model, zanim go wymieni. Uwaga metodologiczna: liczby dla poszczególnych zestawów pochodzą od producenta; oszacowanie dla ostatnich dziesięciu języków to wyliczenie wujec.ai ze średnich, przy założeniu równej wagi każdego języka.