GLM-TTS
Z.ai (Zhipu AI) · China · 2025
Model syntezy mowy Z.ai: klonuje glos z trzech do dziesieciu sekund nagrania, czyta tekst dokladniej niz ktorykolwiek rywal w tabeli producenta i jako jedyny element dorobku audio tej firmy nie jest sprzedawany w jej API.
GLM-TTS to system syntezy mowy Z.ai, opublikowany 10 grudnia 2025 roku razem z raportem technicznym. Zbudowany jest w dwóch etapach: model językowy o architekturze Llama zamienia zapisany tekst w tokeny mowy, a model flow matching przekształca te tokeny w spektrogramy melowe, które wokoder zamienia w dźwięk. Etap językowy liczy około 1,55 miliarda parametrów i wydawany jest w formacie float32, więc samo pobranie to 6,2 GB, zanim doliczy się moduły flow, wokodera i tokenizatora. Główną funkcją jest klonowanie głosu bez douczania: wystarczy od trzech do dziesięciu sekund nagrania wzorcowego, żeby odtworzyć mówiącego. Nad tym nadbudowano to, co Z.ai uważa za swój wkład badawczy — model dostrojono uczeniem ze wzmocnieniem (GRPO) wobec czterech osobnych nagród: podobieństwa głosu, odsetka błędnych znaków, emocji i śmiechu. Deklarowanym celem było usunięcie płaskiej intonacji typowej dla mowy syntetycznej. Tabelę porównawczą producenta warto przeczytać uważnie, bo nie mówi tego, co zwykle mówią tabele marketingowe. GLM-TTS po uczeniu ze wzmocnieniem osiąga najniższy w zestawieniu odsetek błędnych znaków — 0,89 wobec 1,12 zamkniętego Seed-TTS oraz 1,38 i 1,53 otwartych CosyVoice2 i F5-TTS. Ale w podobieństwie głosu, czyli w tym, na ile sklonowany głos brzmi jak dana osoba, nadal wygrywa model zamknięty: 79,6 wobec 76,4. Po ludzku: ten model czyta tekst dokładniej niż wszystko, z czym go zmierzono, i wciąż podrabia głos odrobinę mniej przekonująco niż komercyjny system, z którym go zmierzono. Do każdej decyzji o użyciu należą dwie uwagi praktyczne. Po pierwsze, licencja nie jest czysta: karta modelu deklaruje MIT, repozytorium na GitHubie zawiera plik Apache 2.0, a przy samych wagach nie ma żadnego dokumentu licencyjnego — rozbieżność, którą każdy wypuszczający mowę syntetyczną komercyjnie powinien wyjaśnić z producentem, a nie założyć. Po drugie, ten model nie jest na sprzedaż. Cennik API Z.ai obejmuje rozpoznawanie mowy i nic poza tym; synteza istnieje wyłącznie jako plik do pobrania i strona demonstracyjna. To odwrotność sytuacji z linią transkrypcyjną tej firmy, gdzie płatny model hostowany ma limit 30 sekund na wywołanie, a darmowe rodzeństwo do pobrania nie ma go wcale.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!