MDL-1487EST.2026 · IDX.397
AudioW produkcji

Qwen3-ASR

Alibaba Cloud · China · 2026

Otwarty model Alibaby do spisywania mowy: 30 języków i 22 chińskie dialekty, tryb strumieniowy i offline w jednym pliku, lepszy od Whispera poza najrzadszymi językami.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Qwen3-ASR to część rozpoznająca mowę ze styczniowego zestawu głosowego Alibaby: dwa modele o otwartych wagach, 1,7 mld i 0,6 mld parametrów, oba zbudowane na słuchu modelu bazowego Qwen3-Omni i wydane na licencji Apache 2.0. Rozpoznają język nagrania i spisują je w 30 językach — w tym po polsku — a do tego w 22 chińskich dialektach i po angielsku z akcentami z kilku krajów. Nietypowo dla tej klasy jeden i ten sam model obsługuje zarówno spisywanie długich nagrań w trybie wsadowym, jak i transkrypcję na żywo, a producent uczył go nie tylko mowy, lecz również śpiewu i piosenek z podkładem muzycznym, czego większość programów do transkrypcji wprost odmawia. W publicznych testach wersja 1,7 mld wypada nieco lepiej niż Whisper-large-v3 OpenAI, który od 2023 roku był domyślnym wyborem wśród modeli otwartych: 4,90 wobec 5,27 procent błędnych słów na zbiorze Fleurs, 9,18 wobec 10,77 na CommonVoice, 8,55 wobec 8,62 na MLS. Wyraźniej wygrywa w rozpoznawaniu samego języka nagrania — 97,9 procent wobec 94,1. Przewaga topnieje wraz z oddalaniem się od dużych języków, a na dziesięciu najrzadszych w zestawie testowym — czeskim, duńskim, greckim, perskim, fińskim, filipińskim, węgierskim, macedońskim, rumuńskim i szwedzkim — Whisper wciąż wygrywa z dużym zapasem, 8,16 wobec 12,60. Mniejszy model 0,6 mld oddaje część dokładności za przepustowość i jest pomyślany do obsługi wielu strumieni naraz. Przełączenie któregokolwiek z modeli z trybu wsadowego na strumieniowy też kosztuje dokładność: średnia wersji 1,7 mld rośnie z 2,69 do 3,33. Jedno zastrzeżenie do nazw — opublikowane pliki wag mieszczą 2,35 miliarda parametrów w modelu nazwanym 1.7B i 0,94 miliarda w nazwanym 0.6B, bo koder dźwięku liczony jest poza nazwą.

#speech recognition#open weights#streaming#multilingual#transcription
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję