MDL-4083EST.2025 · IDX.509
AudioW produkcji

GLM-ASR-Nano-2512

Z.ai (Zhipu AI) · China · 2025

Otwarty model rozpoznawania mowy Z.ai o 1,5 mld parametrów, na licencji MIT, dostrojony do kantońskiego i do mowy zbyt cichej dla innych modeli.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

GLM-ASR-Nano-2512 to otwarty model rozpoznawania mowy firmy Z.ai, ogłoszony 10 grudnia 2025 roku i opublikowany na licencji MIT, o 1,5 miliarda parametrów. Jest pobieralną połową dorobku firmy w mowie: hostowane rodzeństwo, GLM-ASR-2512, sprzedawane jest przez API Z.ai po 0,03 USD za milion tokenów, czyli mniej więcej 0,0024 USD za minutę nagrania. Karta modelu stawia sprawę wprost: model o 1,5 mld parametrów wypada lepiej niż Whisper large-v3 w kilku zestawach testów, pozostając na tyle mały, żeby chodzić na laptopie. Z.ai podaje najniższy średni odsetek błędów wśród porównywalnych modeli otwartych (4,10) i szczególnie dobre wyniki na chińskich nagraniach zebrań oraz mowy czytanej. Dla wariantu hostowanego firma podaje osobno odsetek błędnych znaków na poziomie 0,0717. Dwie zdolności są na tyle nietypowe, że stanowią właściwy powód sięgnięcia po ten model. Pierwsza to dialekty: poza mandaryńskim i angielskim jest jawnie dostrojony do kantońskiego, syczuańskiego, min nan i wu — czyli odmian, które modele ogólnego przeznaczenia zapisują źle albo wcale. Druga to cicha mowa. Model uczono na celowo cichych nagraniach, takich, które inne systemy odrzucają jako ciszę: dyktowanie we wspólnym biurze, szeptana uwaga w nagraniu, wywiad, w którym druga osoba siedzi daleko od mikrofonu. Moment ma znaczenie dla każdego, kto buduje coś na mowie. OpenAI wpisało własną hostowaną końcówkę whisper-1 na listę wycofań 26 sierpnia 2026 roku i usuwa ją 26 lutego 2027; otwarte wagi Whispera zostają, ale wygodna wersja hostowana już nie. GLM-ASR-Nano pojawił się rok wcześniej jako mniejszy model na licencji MIT, twierdzący, że te wagi pokonuje — a przy około 61 tysiącach pobrań w oknie trzydziestu dni jest przyjmowany w tempie, które nie ma nic wspólnego z czyimkolwiek cennikiem.

#speech recognition#open source#multilingual#transcription
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję