MDL-4363EST.2026 · IDX.969
AudioW produkcji

Qwen3-TTS

Alibaba Cloud · China · 2026

Otwarty silnik mowy Alibaby: dziesięć języków, pierwsza paczka dźwięku w 97 ms i klon głosu z trzech sekund nagrania.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Qwen3-TTS, udostępniony na otwartej licencji 22 stycznia 2026 roku, to odpowiedź zespołu Qwen na zamknięte silniki mowy, które dominują na rynku. Opublikowano od razu dwa rozmiary — 0,6 mld parametrów dla maszyn ze skromną pamięcią graficzną i 1,7 mld dla najlepszej jakości — a oba oparto na konstrukcji wieloksiążkowej, w której mowa wychodzi strumieniem, zamiast być renderowana po zakończeniu zdania. Pierwsza paczka dźwięku pojawia się już po 97 milisekundach, a to próg, poniżej którego syntetyczny głos przestaje brzmieć jak nagranie, a zaczyna jak odpowiedź. Model łączy trzy umiejętności: klonowanie mówcy z około trzech sekund nagrania wzorcowego, projektowanie zupełnie nowego głosu na podstawie jego opisu słownego oraz czytanie gotowymi barwami premium — jest ich dziewięć, w różnych płciach, wieku i językach, a do tego dochodzą profile dialektów chińskich, w tym pekińskiego i syczuańskiego. Wagi objęto licencją Apache 2.0, więc w odróżnieniu od większości konkurentów tej klasy model wolno używać komercyjnie bez osobnej umowy, a uruchamia się go na konsumenckiej karcie graficznej. Alibaba sprzedaje też wariant hostowany w Model Studio dla tych, którzy woleliby go nie stawiać u siebie.

#text to speech#voice cloning#open weights#streaming#multilingual
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję