MDL-4722EST.2025 · IDX.311
AudioW produkcji

Fun-Audio-Chat-8B

Alibaba Cloud · China · 2025

Model językowy dźwięku z laboratorium FunAudioLLM Alibaby, na otwartych wagach, zbudowany do rozmowy głosem: słucha, odpowiada mową, na polecenie wypowiedziane głosem wywołuje funkcje i jest strojony pod empatyczny sposób mówienia. Waży 9,45 mld parametrów, mimo ósemki w nazwie.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Fun-Audio-Chat-8B to duży model językowy dźwięku, opublikowany przez zespół FunAudioLLM Alibaby 23 grudnia 2025 roku na licencji Apache 2.0, razem z kodem trenowania i uruchamiania. W odróżnieniu od silnika transkrypcji ma prowadzić rozmowę: na wejściu jest dźwięk, na wyjściu tekst albo synteza mowy, a wypowiedziane głosem polecenie potrafi wywołać funkcję w systemie. Pomysł, na którym stoi, autorzy nazywają dwurozdzielczą reprezentacją mowy. Znaki mowy płyną zwykle w tempie 25 Hz, a znaki tekstu mniej więcej 3 Hz, więc wspólny model zużywa większość swojej pojemności na szybszy strumień i zapomina to, co umiał jego tekstowy szkielet. Tutaj wspólny szkielet czyta dźwięk w tempie 5 Hz, grupując znaki po pięć, a mowę w pełnym tempie 25 Hz wytwarza osobna głowica. Producent podaje, że to zmniejsza o mniej więcej połowę liczbę godzin pracy kart graficznych potrzebnych do trenowania. Druga technika, nazwana Core-Cocktail, to dwuetapowe dostrajanie ze scaleniem pośrednim, wymierzone w ten sam problem zapominania. Nazwa zaniża to, co się pobiera. Opublikowany zestaw wag ma 9,45 miliarda parametrów w formacie bfloat16, a nie osiem miliardów. Plik konfiguracyjny pokazuje dlaczego: tekstowy szkielet jest dokładnie taki jak w Qwen3-8B (36 warstw, 4096 wymiarów, 32 głowice uwagi na 8 głowic klucz-wartość, słownik 151936 znaków) i odpowiada za 8,19 miliarda. Nad nim siedzi 32-warstwowy enkoder dźwięku o szerokości 1280, czytający 128 pasm mel w oknach po 30 sekund, a obok głowica mowy o geometrii modelu Qwen3-0,6B. Liczba w nazwie opisuje tę część, która myśli, a nie te, które słuchają i mówią. Stąd też wymaganie około 24 GB pamięci karty graficznej, a nie 16 GB, których spodziewałby się ktoś liczący ośmiomiliardowy model. Jeszcze jedna rzecz praktyczna: wyjście głosowe nie jest samowystarczalne. Instrukcja szybkiego startu każe pobrać obok modelu głównego drugi zestaw wag, Fun-CosyVoice3-0.5B-2512. Raport techniczny opisuje trzech członków rodziny — ten model 8B, wariant mieszanki ekspertów 30B-A3B oraz odmianę pełnodupleksową, zdolną słuchać i mówić jednocześnie. Otwarty jest wyłącznie ten pierwszy. Języki ograniczają się do angielskiego i chińskiego, więc polskojęzyczny użytkownik nie ma tu czego szukać. Producent podaje czołowe wyniki wśród modeli podobnej wielkości w mówionych pytaniach i odpowiedziach (OpenAudioBench, VoiceBench, UltraEval-Audio), rozumieniu dźwięku (MMAU, MMAU-Pro, MMSU), wywoływaniu funkcji głosem (Speech-ACEBench, Speech-BFCL, Speech-SmartInteract) oraz wykonywaniu poleceń mówionych (VStyle).

#speech-to-speech#audio language model#voice assistant#open weights#function calling
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję