Eleven v3 to flagowy model syntezy mowy firmy ElevenLabs — założonej przez dwóch Polaków spółki głosowej, która stała się punktem odniesienia dla całej konkurencji. Jego cechą wyróżniającą jest sterowalność: w tekście można umieszczać znaczniki dźwiękowe w rodzaju [laughs], [whispers] czy [door slam], a model je odgrywa, co zamienia syntezę mowy z lektorowania w aktorstwo. Towarzyszące API Text to Dialogue generuje całe wymiany zdań między kilkoma mówcami z ciągłością emocjonalną sceny, a nie jako stos osobnych kwestii. Model obsługuje ponad siedemdziesiąt języków i napędza znaczną część rynku audiobooków AI, dubbingu i dialogów w grach.
#text to speech#voice cloning#multilingual#audiobooks#dialogue