MDL-6802EST.2025 · IDX.672
AudioW produkcji

Kimi-Audio 7B Instruct

Moonshot AI · China · 2025

Jeden otwarty model do wszystkiego, co dźwiękowe: transkrypcja, rozpoznawanie dźwięków i emocji oraz rozmowa, w której model odpowiada głosem. Wytrenowany na 13 milionach godzin nagrań.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Kimi-Audio 7B Instruct, opublikowany 25 kwietnia 2025 r., to próba zastąpienia przez Moonshot AI całego zestawu osobnych narzędzi dźwiękowych jednym modelem. Te same wagi obsługują rozpoznawanie mowy, odpowiadanie na pytania o nagranie, opisywanie dźwięku, rozpoznawanie emocji w mowie, klasyfikację zdarzeń i scen dźwiękowych oraz rozmowę głosową od początku do końca — czyli zadania, które typowy system produkcyjny składa z trzech lub czterech wyspecjalizowanych elementów. We wstępnym treningu wykorzystano ponad 13 milionów godzin nagrań: mowy, muzyki i dźwięków otoczenia, obok danych tekstowych. Taki zakres umożliwia architektura. Dźwięk wchodzi jednocześnie w dwóch postaciach: jako ciągła reprezentacja akustyczna, która zachowuje brzmienie, i jako dyskretne tokeny semantyczne niosące treść wypowiedzi. Rdzeń językowy generuje potem tokeny tekstu i dźwięku równoległymi głowicami, a strumieniowy detokenizer oparty na dopasowaniu przepływu zamienia tokeny dźwiękowe z powrotem w falę jeszcze w trakcie tworzenia odpowiedzi — i to dzięki temu wypowiedź nie spóźnia się względem rozmowy. Dwie uwagi dla czytającego specyfikację. Po pierwsze, nazwa zaniża model: 7B odnosi się do szkieletu językowego, a opublikowane wagi mają 9,8 miliarda parametrów, gdy doliczyć tokenizer dźwięku i głowice generujące. Po drugie, deklaracja Moonshota o najlepszych wynikach w testach dźwiękowych nie ma pokrycia w liczbach na samej karcie modelu — wyniki są wyłącznie w raporcie technicznym w formacie PDF w repozytorium projektu, więc karty nie da się sprawdzić na jej własnych danych. Wagi wersji instrukcyjnej i bazowej są na Hugging Face na licencji MIT; kod uruchomieniowy jest w osobnym repozytorium z obrazem Dockera i bez własnego pliku licencji. Producent nie prowadzi dla tego modelu płatnego punktu dostępowego.

#open weights#speech recognition#speech synthesis#audio understanding#MIT licence
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję