MDL-8163EST.2026 · IDX.125
AudioW produkcji

Sonic 3.5

Cartesia · USA · 2026

Model głosowy, który nie jest transformerem — architektura przestrzeni stanów dała mu mowę poniżej 90 ms w 42 językach.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Sonic 3.5 to flagowy model syntezy mowy firmy Cartesia i najbardziej widoczny komercyjny produkt zbudowany na modelach przestrzeni stanów zamiast na architekturze transformera, która dominuje w reszcie branży. Ten wybór jest sednem sprawy: modele SSM przetwarzają sekwencje przy użyciu wewnętrznego stanu o stałym rozmiarze, zamiast wciąż od nowa czytać rosnący kontekst, co pasuje do strumieniowania dźwięku i dzięki czemu Cartesia schodzi poniżej 90 milisekund do pierwszego dźwięku, utrzymując się jednocześnie na czele niezależnych porównań naturalności. Model obsługuje 42 języki, w tym polski, a odświeżenie z 2026 roku skupiło się nie na jakości nagłówkowej, lecz na usterkach, które w praktyce dyskwalifikują asystentów głosowych: ciągi alfanumeryczne — numery zamówień, numery telefonów, identyfikatory i adresy e-mail — są wymawiane poprawnie we wszystkich językach bez wstępnej obróbki tekstu, a angielskie homografy w rodzaju read, bass czy bow rozstrzygane są z kontekstu. Cartesia ogłosiła go razem z Ink-2, swoim modelem transkrypcji strumieniowej, domykając w ten sposób obie połowy pętli głosowej czasu rzeczywistego.

#text to speech#low latency#voice agents#state space models#multilingual
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję