MDL-5008EST.2026 · IDX.975
AudioW produkcji

Gemini 3.1 Flash TTS

Google DeepMind · USA · 2026

Mowa, którą reżyseruje się jak aktora — didaskalia wpisane wprost w polecenie.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Gemini 3.1 Flash TTS to obecny model generowania mowy Google i ta część rodziny Gemini, którą zbudowano do jednostronnej narracji, a nie do rozmowy. Wyróżnia go sterowalność: zamiast wybierać głos z zamkniętej listy i godzić się na taką interpretację, jaką dostanie, programista wpisuje sposób wykonania wprost w polecenie — tu wolniej, tam szeptem — używając zestawu znaczników ekspresji. Czyni to z niego narzędzie do audiobooków, dubbingu i generowanych podcastów, a nie do obsługi połączeń, którą zajmują się modele Live. Cennik powtarza kształt reszty linii: dolar za milion tokenów tekstu na wejściu i dwadzieścia za milion dźwięku na wyjściu, więc koszt leży niemal w całości po stronie dźwięku. Google udostępnia go jako publiczną zapowiedź, bezpłatnie w darmowym progu. Dwa starsze rodzeństwa zostają dla zespołów potrzebujących ustabilizowanego zachowania: 2.5 Flash TTS do taniej pracy o niskim opóźnieniu i 2.5 Pro TTS do produkcji o wysokiej wierności.

#text to speech#voice synthesis#streaming#expressive audio#api only
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję