MDL-8691EST.2026 · IDX.140
AudioW produkcji

Soniox stt-rt-v5

Soniox · USA · 2026

Model transkrypcji na żywo rozliczany za token, a nie za minutę, co wychodzi mniej więcej o jedną trzecią taniej za godzinę niż modele, z którymi bywa porównywany.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Model stt-rt-v5 zamienia mowę na tekst na żywo dla firmy Soniox, założonej w 2020 roku w Foster City w Kalifornii przez Klemena Simonica, wcześniej inżyniera sztucznej inteligencji w Facebooku i Google. Zastąpił model stt-rt-v4 16 czerwca 2026; starszy wyłączono dwa tygodnie później, 30 czerwca, przekierowując zapytania do nowego bez informowania użytkownika. Bliźniaczy model do nagrań, stt-async-v5, wyszedł pięć dni wcześniej. Model obejmuje ponad 60 języków, sam rozpoznaje, w którym mówi rozmówca, i przełącza się między nimi w obrębie jednej rozmowy. Tłumaczy w trakcie transkrypcji — producent liczy ponad 3600 par językowych — i rozdziela mówców na bieżąco, a nie po zakończeniu nagrania. Soniox wymienia jako osobny cel tego wydania lepszy zapis liczb, dat, adresów pocztowych i elektronicznych oraz kodów, czyli tych fragmentów zapisu, w których błąd rzuca się w oczy natychmiast. Tym, co ten model wyróżnia, jest jednak rozliczenie, nie technika. Soniox liczy mowę w tokenach, tej samej jednostce co modele tekstowe: dźwięk wejściowy kosztuje 2,00 USD za milion tokenów przy sesji na żywo, tekst wyjściowy 4,00 USD za milion. Firma przelicza to na około 0,12 USD za godzinę na żywo i 0,10 USD za godzinę nagrania, wobec 0,21 USD za nagranie u AssemblyAI i 0,61 USD u Gladii. To czyni go, w cenniku, najtańszym modelem transkrypcji w tym katalogu. Przy tej liczbie trzeba postawić zastrzeżenie. Rozliczenie za token oznacza, że rachunek zależy od tego, ile powiedziano, a nie tylko ile trwało nagranie, więc gęsta godzina rozmowy kosztuje więcej niż cicha — przelicznik producenta zakłada około 30 tysięcy tokenów dźwięku i 15 tysięcy tokenów tekstu na godzinę. Sam Soniox tłumaczy cenę zbudowaniem własnej warstwy obliczeniowej, a nie promocją. Model jest zamknięty i dostępny wyłącznie jako usługa. Został wyłączony z kampanii testowej, którą Gladia opublikowała w czerwcu 2026 przy Solarii-3, więc niezależnego porównania z bezpośrednią konkurencją tu nie ma.

#speech-to-text#streaming#translation#diarization#code-switching
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję