MDL-6998EST.2024 · IDX.931
AudioW produkcji

SenseVoiceSmall

Alibaba Cloud · China · 2024

Model mowy, który zwraca więcej niż słowa: obok transkrypcji podaje emocję mówiącego i dźwięki w tle — śmiech, oklaski, kaszel, muzykę.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

SenseVoiceSmall to część rozumiejąca mowę z laboratorium FunAudioLLM, dźwiękowego zespołu wewnątrz grupy Tongyi w Alibabie. Model wyszedł w lipcu 2024 roku i do dziś jest najczęściej pobieraną pozycją tego laboratorium. Tam, gdzie zwykły program do transkrypcji zwraca słowa, SenseVoice zwraca linijkę z adnotacjami: w jakim języku mówiono, co powiedziano, jaką emocję niósł głos i jakie dźwięki spoza mowy pojawiły się w nagraniu — muzyka w tle, oklaski, śmiech, płacz, kaszel, kichnięcie. Producent nazywa to wzbogaconą transkrypcją i to dlatego model trafia raczej na wejście systemów analizujących rozmowy z infolinii i asystentów głosowych niż do przygotowywania napisów. U podstaw konstrukcji leży szybkość. Model jest nieautoregresyjny: nie tworzy transkrypcji słowo po słowie, tylko opisuje całe nagranie jednym przebiegiem przez enkoder SANM o pięćdziesięciu blokach i 512 wymiarach stanu ukrytego. Producent podaje 70 milisekund na dziesięć sekund dźwięku — około pięć razy szybciej niż Whisper-small o zbliżonej liczbie parametrów i piętnaście razy szybciej niż Whisper-large. Od czerwca 2026 roku wagi są dostępne również w formacie GGUF, więc model uruchamia się jako jeden samodzielny plik wykonywalny na procesorze, bez karty graficznej i bez Pythona. Dwa zastrzeżenia należą się czytelnikowi. Po pierwsze, obietnica szerokości i obietnica głębi to dwie różne obietnice: model uczono na ponad 400 tysiącach godzin nagrań w ponad pięćdziesięciu językach, ale rozpoznawanie emocji i zdarzeń dźwiękowych producent oferuje dla pięciu — mandaryńskiego, kantońskiego, angielskiego, japońskiego i koreańskiego. Polski mieści się wyłącznie w samej transkrypcji. Po drugie, jest to jedyny model tego laboratorium wydany nie na licencji Apache 2.0, lecz na własnej umowie FunASR, która zastrzega materiał do celów referencyjnych i nauki, odbiera licencję każdemu, kto publicznie oczernia model, a w miejscu prawa właściwego zostawia niewypełniony szablon. Większy SenseVoice-Large przewija się przez wszystkie tabele porównawcze producenta i nigdy nie został opublikowany.

#speech recognition#emotion recognition#audio event detection#open weights#on-device
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję