Deepgram Flux
Deepgram · USA · 2025
Rozpoznawanie mowy przebudowane pod rozmowę: samo rozstrzyga, kiedy skończyłeś mówić, a nie tylko co powiedziałeś.
Deepgram uruchomił Flux 2 października 2025 roku pod etykietą własnego pomysłu — konwersacyjne rozpoznawanie mowy. Różnica jest realna. Klasyczne modele transkrypcyjne buduje się po to, by zamienić nagranie na tekst możliwie wiernie; agent głosowy potrzebuje czegoś innego, a mianowicie wiedzy o tym, w którym momencie człowiek przestał mówić i czeka na odpowiedź. Tę decyzję zwykle dokleja się później prymitywnym licznikiem ciszy i właśnie dlatego tyle asystentów głosowych albo wchodzi rozmówcy w słowo, albo zostawia kłopotliwą pauzę. Flux wbudowuje wykrywanie końca wypowiedzi w sam model rozpoznawania i wydaje werdykt w mniej niż 400 milisekund, obsługując przy tym wtrącenia. 29 kwietnia 2026 roku Deepgram udostępnił powszechnie wersję wielojęzyczną: dziesięć języków w jednym modelu i — co rzadkie — wykrywanie oraz przełączanie między nimi w trakcie jednej rozmowy, bez deklarowania języka z góry. Model działa przez chmurowe API Deepgrama z punktami dostępowymi w Europie albo we własnej serwerowni, dla organizacji, które nie mogą wypuścić dźwięku poza własną infrastrukturę.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!