Sonic 3.5 to flagowy model syntezy mowy firmy Cartesia i najbardziej widoczny komercyjny produkt zbudowany na modelach przestrzeni stanów zamiast na architekturze transformera, która dominuje w reszcie branży. Ten wybór jest sednem sprawy: modele SSM przetwarzają sekwencje przy użyciu wewnętrznego stanu o stałym rozmiarze, zamiast wciąż od nowa czytać rosnący kontekst, co pasuje do strumieniowania dźwięku i dzięki czemu Cartesia schodzi poniżej 90 milisekund do pierwszego dźwięku, utrzymując się jednocześnie na czele niezależnych porównań naturalności. Model obsługuje 42 języki, w tym polski, a odświeżenie z 2026 roku skupiło się nie na jakości nagłówkowej, lecz na usterkach, które w praktyce dyskwalifikują asystentów głosowych: ciągi alfanumeryczne — numery zamówień, numery telefonów, identyfikatory i adresy e-mail — są wymawiane poprawnie we wszystkich językach bez wstępnej obróbki tekstu, a angielskie homografy w rodzaju read, bass czy bow rozstrzygane są z kontekstu. Cartesia ogłosiła go razem z Ink-2, swoim modelem transkrypcji strumieniowej, domykając w ten sposób obie połowy pętli głosowej czasu rzeczywistego.
#text to speech#low latency#voice agents#state space models#multilingual