Qwen3-ForcedAligner-0.6B
Alibaba Cloud · China · 2026
Wąskie narzędzie do jednego zadania: dopasowuje gotowy tekst do nagrania słowo po słowie, dwa do czterech razy dokładniej niż narzędzie używane dziś przy napisach.
Qwen3-ForcedAligner-0.6B to najmniej efektowny i chyba najbardziej praktyczny model ze styczniowego zestawu głosowego Alibaby. Nie spisuje mowy i nie mówi. Dostaje nagranie oraz tekst, o którym wiadomo, że mu odpowiada, i podaje, w której milisekundzie zaczyna się i kończy każde słowo, znak albo fraza. To właśnie ta operacja stoi za rozstawianiem napisów w czasie, karaoke, synchronizacją audiobooka z e-bookiem, dubbingiem i przygotowaniem materiału uczącego dla innych modeli mowy — robotą, którą zwykle wykonuje się zlepkiem starszych narzędzi. W zestawieniu z nimi różnica nie jest niewielka. Mierząc średnie odchylenie wyznaczonej granicy słowa od ręcznie opisanej, model myli się o 37,5 ms po angielsku, podczas gdy WhisperX — warstwa dopasowania, po którą sięga większość pracowni napisów — myli się o 92,1 ms; po francusku 41,7 wobec 145,3, po niemiecku 46,5 wobec 165,1, po chińsku 33,1 wobec 161,1 u starszego Monotonic-Alignera. Obsługuje też japoński, koreański i portugalski, w których narzędzia porównawcze nie dają żadnego wyniku. Ograniczenia są uczciwie wąskie: jedenaście języków (chiński, angielski, kantoński, francuski, niemiecki, włoski, japoński, koreański, portugalski, rosyjski, hiszpański), wyłącznie mowa — bez śpiewu — i fragmenty do pięciu minut naraz, więc dłuższy materiał trzeba pociąć. Model jest nieautoregresyjny i stąd bierze się jego szybkość, a przy 0,92 miliarda parametrów w plikach wag działa na skromnym sprzęcie. Licencja Apache 2.0, a do Qwen3-ASR podpina się wprost jako opcjonalny stopień wyznaczania znaczników czasu.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!