Octave 2
Hume AI · USA · 2025
Model mowy, który czyta scenariusz jak aktor — reżyserujesz go zwykłym zdaniem, nie znacznikami.
Octave 2 to model mowy firmy Hume AI, a różnica wobec zwykłej syntezy mowy jest głównym twierdzeniem producenta: zamiast zamieniać znaki na dźwięk, Octave czyta scenariusz tak, jak zrobiłby to aktor, wnioskując z samych słów, kiedy szeptać, krzyczeć, a kiedy spokojnie tłumaczyć. Użytkownik może też reżyserować go zwykłym zdaniem — opisać postać i sposób mówienia, a model zbuduje pasujący głos, zamiast wybierać ze stałej listy. Druga generacja, wydana 1 października 2025 roku, uczyniła to podejście praktycznym dla rozmowy na żywo: poniżej 200 milisekund do dźwięku, o 40 procent szybciej niż Octave 1 i o połowę taniej, w jedenastu językach — arabskim, angielskim, francuskim, niemieckim, hindi, włoskim, japońskim, koreańskim, portugalskim, rosyjskim i hiszpańskim — przy zapowiedzi co najmniej dwudziestu. Doszła rozmowa wielu mówców, konwersja głosu podmieniająca jeden głos na drugi z zachowaniem czasu i fonetyki oraz edycja na poziomie fonemów, pozwalająca poprawić wymowę nazwiska lub akcentowanego słowa. Rodowód Hume w badaniach nad emocjami widać w produkcie: firma sprzedaje intencję ekspresyjną, a nie wierność brzmienia, i tym konkuruje z ElevenLabs — interpretacją, nie samym opóźnieniem.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!