MDL-1067EST.2025 · IDX.535
AudioW produkcji

Deepgram Flux

Deepgram · USA · 2025

Rozpoznawanie mowy przebudowane pod rozmowę: samo rozstrzyga, kiedy skończyłeś mówić, a nie tylko co powiedziałeś.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Deepgram uruchomił Flux 2 października 2025 roku pod etykietą własnego pomysłu — konwersacyjne rozpoznawanie mowy. Różnica jest realna. Klasyczne modele transkrypcyjne buduje się po to, by zamienić nagranie na tekst możliwie wiernie; agent głosowy potrzebuje czegoś innego, a mianowicie wiedzy o tym, w którym momencie człowiek przestał mówić i czeka na odpowiedź. Tę decyzję zwykle dokleja się później prymitywnym licznikiem ciszy i właśnie dlatego tyle asystentów głosowych albo wchodzi rozmówcy w słowo, albo zostawia kłopotliwą pauzę. Flux wbudowuje wykrywanie końca wypowiedzi w sam model rozpoznawania i wydaje werdykt w mniej niż 400 milisekund, obsługując przy tym wtrącenia. 29 kwietnia 2026 roku Deepgram udostępnił powszechnie wersję wielojęzyczną: dziesięć języków w jednym modelu i — co rzadkie — wykrywanie oraz przełączanie między nimi w trakcie jednej rozmowy, bez deklarowania języka z góry. Model działa przez chmurowe API Deepgrama z punktami dostępowymi w Europie albo we własnej serwerowni, dla organizacji, które nie mogą wypuścić dźwięku poza własną infrastrukturę.

#speech to text#voice agents#turn taking#real time#multilingual
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję