MDL-8997EST.2025 · IDX.842
AudioW produkcji

Octave 2

Hume AI · USA · 2025

Model mowy, który czyta scenariusz jak aktor — reżyserujesz go zwykłym zdaniem, nie znacznikami.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Octave 2 to model mowy firmy Hume AI, a różnica wobec zwykłej syntezy mowy jest głównym twierdzeniem producenta: zamiast zamieniać znaki na dźwięk, Octave czyta scenariusz tak, jak zrobiłby to aktor, wnioskując z samych słów, kiedy szeptać, krzyczeć, a kiedy spokojnie tłumaczyć. Użytkownik może też reżyserować go zwykłym zdaniem — opisać postać i sposób mówienia, a model zbuduje pasujący głos, zamiast wybierać ze stałej listy. Druga generacja, wydana 1 października 2025 roku, uczyniła to podejście praktycznym dla rozmowy na żywo: poniżej 200 milisekund do dźwięku, o 40 procent szybciej niż Octave 1 i o połowę taniej, w jedenastu językach — arabskim, angielskim, francuskim, niemieckim, hindi, włoskim, japońskim, koreańskim, portugalskim, rosyjskim i hiszpańskim — przy zapowiedzi co najmniej dwudziestu. Doszła rozmowa wielu mówców, konwersja głosu podmieniająca jeden głos na drugi z zachowaniem czasu i fonetyki oraz edycja na poziomie fonemów, pozwalająca poprawić wymowę nazwiska lub akcentowanego słowa. Rodowód Hume w badaniach nad emocjami widać w produkcie: firma sprzedaje intencję ekspresyjną, a nie wierność brzmienia, i tym konkuruje z ElevenLabs — interpretacją, nie samym opóźnieniem.

#text to speech#emotion#voice design#multilingual#voice agents
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję