Gemini 3.1 Flash TTS
Google DeepMind · USA · 2026
Mowa, którą reżyseruje się jak aktora — didaskalia wpisane wprost w polecenie.
Gemini 3.1 Flash TTS to obecny model generowania mowy Google i ta część rodziny Gemini, którą zbudowano do jednostronnej narracji, a nie do rozmowy. Wyróżnia go sterowalność: zamiast wybierać głos z zamkniętej listy i godzić się na taką interpretację, jaką dostanie, programista wpisuje sposób wykonania wprost w polecenie — tu wolniej, tam szeptem — używając zestawu znaczników ekspresji. Czyni to z niego narzędzie do audiobooków, dubbingu i generowanych podcastów, a nie do obsługi połączeń, którą zajmują się modele Live. Cennik powtarza kształt reszty linii: dolar za milion tokenów tekstu na wejściu i dwadzieścia za milion dźwięku na wyjściu, więc koszt leży niemal w całości po stronie dźwięku. Google udostępnia go jako publiczną zapowiedź, bezpłatnie w darmowym progu. Dwa starsze rodzeństwa zostają dla zespołów potrzebujących ustabilizowanego zachowania: 2.5 Flash TTS do taniej pracy o niskim opóźnieniu i 2.5 Pro TTS do produkcji o wysokiej wierności.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!