Qwen3-TTS
Alibaba Cloud (Qwen / Tongyi Lab) · China · 2026
Otwarty silnik mowy Alibaby: dziesiec jezykow, pierwsza paczka dzwieku w 97 ms i klon glosu z trzech sekund nagrania.
Qwen3-TTS, udostepniony na otwartej licencji 22 stycznia 2026 roku, to odpowiedz zespolu Qwen na zamkniete silniki mowy, ktore dominuja na rynku. Opublikowano od razu dwa rozmiary — 0,6 mld parametrow dla maszyn ze skromna pamiecia graficzna i 1,7 mld dla najlepszej jakosci — a oba oparto na konstrukcji wieloksiazkowej, w ktorej mowa wychodzi strumieniem, zamiast byc renderowana po zakonczeniu zdania. Pierwsza paczka dzwieku pojawia sie juz po 97 milisekundach, a to prog, ponizej ktorego syntetyczny glos przestaje brzmiec jak nagranie, a zaczyna jak odpowiedz. Model laczy trzy umiejetnosci: klonowanie mowcy z okolo trzech sekund nagrania wzorcowego, projektowanie zupelnie nowego glosu na podstawie jego opisu slownego oraz czytanie gotowymi barwami premium — jest ich dziewiec, w roznych plciach, wieku i jezykach, a do tego dochodza profile dialektow chinskich, w tym pekinskiego i syczuanskiego. Wagi objeto licencja Apache 2.0, wiec w odroznieniu od wiekszosci konkurentow tej klasy model wolno uzywac komercyjnie bez osobnej umowy, a uruchamia sie go na konsumenckiej karcie graficznej. Alibaba sprzedaje tez wariant hostowany w Model Studio dla tych, ktorzy woleliby go nie stawiac u siebie.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!