Qwen3-TTS
Alibaba Cloud · China · 2026
Otwarty silnik mowy Alibaby: dziesięć języków, pierwsza paczka dźwięku w 97 ms i klon głosu z trzech sekund nagrania.
Qwen3-TTS, udostępniony na otwartej licencji 22 stycznia 2026 roku, to odpowiedź zespołu Qwen na zamknięte silniki mowy, które dominują na rynku. Opublikowano od razu dwa rozmiary — 0,6 mld parametrów dla maszyn ze skromną pamięcią graficzną i 1,7 mld dla najlepszej jakości — a oba oparto na konstrukcji wieloksiążkowej, w której mowa wychodzi strumieniem, zamiast być renderowana po zakończeniu zdania. Pierwsza paczka dźwięku pojawia się już po 97 milisekundach, a to próg, poniżej którego syntetyczny głos przestaje brzmieć jak nagranie, a zaczyna jak odpowiedź. Model łączy trzy umiejętności: klonowanie mówcy z około trzech sekund nagrania wzorcowego, projektowanie zupełnie nowego głosu na podstawie jego opisu słownego oraz czytanie gotowymi barwami premium — jest ich dziewięć, w różnych płciach, wieku i językach, a do tego dochodzą profile dialektów chińskich, w tym pekińskiego i syczuańskiego. Wagi objęto licencją Apache 2.0, więc w odróżnieniu od większości konkurentów tej klasy model wolno używać komercyjnie bez osobnej umowy, a uruchamia się go na konsumenckiej karcie graficznej. Alibaba sprzedaje też wariant hostowany w Model Studio dla tych, którzy woleliby go nie stawiać u siebie.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!