MiniMax Speech 2.8
MiniMax · China · 2026
Synteza mowy, której atutem jest niedoskonałość: oddycha, waha się i chrząka na zawołanie.
MiniMax Speech 2.8, wydany 11 sierpnia 2026, to model zamiany tekstu na mowę szanghajskiej firmy i nietypowo bezpośrednie przyznanie, po czym wciąż poznaje się sztuczny głos. Producent sam pisze, że dawne głosy AI brzmiały chłodno, bo były zbyt doskonałe; sztandarowa funkcja wersji 2.8, natywne znaczniki dźwiękowe, modeluje wypełniacze, których pełna jest prawdziwa mowa — „um”, „uh”, oddechy, śmiech, chrząknięcie — jako pełnoprawne elementy tekstu, a nie efekt dokładany po syntezie, dzięki czemu rytm, wysokość i pauzy układają się wokół nich. Druga obietnica dotyczy klonowania głosu. MiniMax podaje, że dziesięciosekundowa próbka wystarcza, by uchwycić barwę, oddech i tempo mówiącego, a cennik zakłada użycie na co dzień: sklonowany głos kosztuje 1,50 dolara, zaprojektowany 3 dolary. Sama synteza rozliczana jest za znaki — 60 dolarów za milion w wariancie turbo i 100 dolarów za milion w HD. Trzeci wątek jest inżynierski, nie wyrazowy: przebudowany łańcuch przetwarzania ma usuwać z wyniku szum tła i zniekształcenia syntezy. W kwestii wielojęzyczności firma jest celowo powściągliwa. Zamiast ogłosić liczbę języków, pisze, że naprawiła „przeciekanie akcentu” w jednej parze — mandaryńskim i japońskim — gdzie tony i wymowa dotąd się rozjeżdżały, i obiecuje to samo dla kolejnych języków, nie podając których ani kiedy. Model jest zamknięty: nie ma wag, jest produkt MiniMax Audio i API platformy.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!