MDL-4363EST.2026 · IDX.969
AudioW produkcji

Qwen3-TTS

Alibaba Cloud (Qwen / Tongyi Lab) · China · 2026

Otwarty silnik mowy Alibaby: dziesiec jezykow, pierwsza paczka dzwieku w 97 ms i klon glosu z trzech sekund nagrania.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Qwen3-TTS, udostepniony na otwartej licencji 22 stycznia 2026 roku, to odpowiedz zespolu Qwen na zamkniete silniki mowy, ktore dominuja na rynku. Opublikowano od razu dwa rozmiary — 0,6 mld parametrow dla maszyn ze skromna pamiecia graficzna i 1,7 mld dla najlepszej jakosci — a oba oparto na konstrukcji wieloksiazkowej, w ktorej mowa wychodzi strumieniem, zamiast byc renderowana po zakonczeniu zdania. Pierwsza paczka dzwieku pojawia sie juz po 97 milisekundach, a to prog, ponizej ktorego syntetyczny glos przestaje brzmiec jak nagranie, a zaczyna jak odpowiedz. Model laczy trzy umiejetnosci: klonowanie mowcy z okolo trzech sekund nagrania wzorcowego, projektowanie zupelnie nowego glosu na podstawie jego opisu slownego oraz czytanie gotowymi barwami premium — jest ich dziewiec, w roznych plciach, wieku i jezykach, a do tego dochodza profile dialektow chinskich, w tym pekinskiego i syczuanskiego. Wagi objeto licencja Apache 2.0, wiec w odroznieniu od wiekszosci konkurentow tej klasy model wolno uzywac komercyjnie bez osobnej umowy, a uruchamia sie go na konsumenckiej karcie graficznej. Alibaba sprzedaje tez wariant hostowany w Model Studio dla tych, ktorzy woleliby go nie stawiac u siebie.

#text to speech#voice cloning#open weights#streaming#multilingual
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję