W modelach głosowych liczba w nazwie opisuje tylko tę część, która myśli
Opublikowano: 5.09.2026 · Źródło: Hugging Face — metadane plików wag (safetensors) i pliki config.json modeli głosowych ↗
Model tekstowy nazwany 8B ma mniej więcej osiem miliardów parametrów. Model głosowy nazwany 7B potrafi mieć dziesięć i pół miliarda. Sprawdziliśmy opublikowane pliki wag dziewięciu modeli i okazuje się, że ta różnica jest regułą, nie wyjątkiem: liczba w nazwie opisuje tekstowy szkielet, a enkoder, który słyszy, i głowica, która mówi, po prostu się nie liczą.
Sprawdzenie jest mechaniczne. Każdy model wystawiony na Hugging Face podaje dokładny rozmiar swoich plików wag, a leżący obok plik konfiguracyjny pokazuje, z czego te wagi się składają. Wobec punktu odniesienia z modeli tekstowych — Llama-3.1-8B-Instruct firmy Meta ma 8,03 miliarda parametrów, czyli trafia w nazwę z dokładnością do pół procenta — modele głosowe wypadają tak. Qwen2.5-Omni-7B Alibaby ma 10,73 miliarda, o pięćdziesiąt trzy procent więcej niż mówi nazwa. Kimi-Audio-7B-Instruct firmy Moonshot ma 9,77 miliarda, o czterdzieści procent więcej. LLaMA-Omni2-7B ma 8,95 miliarda. Qwen3-Omni-30B-A3B, pobrany w ostatnim miesiącu ponad osiemset tysięcy razy, ma 35,26 miliarda. Fun-Audio-Chat-8B, model otwarty przez Alibabę w grudniu, który dziś dołączył do katalogu, ma 9,45 miliarda.
Pomijane są zawsze te same dwa organy. Plik konfiguracyjny Fun-Audio-Chata pokazuje tekstowy szkielet o geometrii dokładnie takiej jak Qwen3-8B — trzydzieści sześć warstw, 4096 wymiarów, słownik 151936 znaków — i to on odpowiada za 8,19 miliarda parametrów. Nad nim siedzi enkoder dźwięku: trzydzieści dwie warstwy, szerokość 1280, dwadzieścia głowic uwagi, 128 pasm mel w oknach po trzydzieści sekund. To, parametr w parametr, kształt enkodera Whisper-large, i powtarza się on u różnych producentów — projekt Ultravox wczytuje po nazwie komponent o identycznej geometrii. Obok szkieletu stoi trzeci moduł, głowica mowy o wymiarach modelu Qwen3-0,6B, której zadaniem jest wydać dźwięk. Razem około 1,25 miliarda parametrów uszu i ust, nieobecnych na etykiecie.
Dla czytelnika dobierającego sprzęt to nie jest ciekawostka. W formacie bfloat16 Llama-3.1-8B-Instruct zajmuje 15,0 GiB i mieści się na karcie 16 GB. Qwen2.5-Omni-7B, którego nazwa obiecuje coś mniejszego, zajmuje 20,0 GiB i nie mieści się. Qwen3-Omni-30B-A3B potrzebuje 65,7 GiB, zanim wczyta pierwszą sekundę dźwięku. Producent Fun-Audio-Chata zapisuje praktyczny skutek wprost w wymaganiach: około 24 GB pamięci karty graficznej, a do tego drugi, osobno pobierany zestaw wag, jeśli model ma mówić, a nie pisać.
Nie wszędzie nazewnictwo wprowadza w błąd. Phi-4-multimodal-instruct Microsoftu reklamuje 5,6 miliarda parametrów i ma 5,57 miliarda, a jego karta w jednym zdaniu wyjaśnia, że liczba obejmuje szkielet Phi-4-Mini razem z enkoderami i adapterami obrazu oraz mowy. Da się.
Błąd bywa też odwrotny i właśnie dlatego trzeba sprawdzać, a nie zakładać kierunek. Repozytorium fixie-ai/ultravox-v0_5-llama-3_1-8b ma ósemkę w nazwie i zawiera 0,69 miliarda parametrów, czyli 1,3 GiB. Szkieletu Llama, do którego nazwa się odwołuje, w środku nie ma — dociąga się go osobno przy uruchomieniu, a w paczce leży aparat słuchu i adapter. Pobierając plik nazwany od modelu 8B, dostaje się w tym wypadku wszystko poza modelem 8B.