Voxtral TTS, opublikowany 23 marca 2026 roku, to pierwszy model generowania mowy Mistrala i lustrzane odbicie transkrypcyjnej rodziny Voxtral: zamiast słuchać, mówi. Cztery miliardy parametrów rozdzielono między dekoder językowy, transformer akustyczny i neuronowy kodek dźwięku, a model wypuszcza mowę strumieniem w trakcie generowania, zamiast czekać na koniec zdania — i właśnie to pozwala używać go w rozmowie na żywo. Na podstawie od pięciu do dwudziestu pięciu sekund nagrania wzorcowego odtwarza akcent i intonację mówcy bez douczania. Wagi są jawne, ale w odróżnieniu od reszty linii Voxtral objęto je licencją niekomercyjną: firmy potrzebują osobnej umowy z Mistralem albo płatnego API.
#text to speech#voice cloning#open weights#streaming#multilingual