GLM-ASR-2512
Z.ai (Zhipu AI) · China · 2025
Hostowany model rozpoznawania mowy Z.ai, w cenie około ćwierć centa za minutę — z limitem 30 sekund nagrania na wywołanie, który wyklucza większość reklamowanych przez producenta zastosowań.
GLM-ASR-2512 to hostowana połowa dorobku Z.ai w rozpoznawaniu mowy, uruchomiona 10 grudnia 2025 roku razem z pobieralnym GLM-ASR-Nano-2512. Sprzedawana jest przez API firmy po 0,03 USD za milion tokenów — czyli około 0,0024 USD za minutę nagrania, mniej więcej połowę tego, co za polecany dziś przez OpenAI model bierze ta firma. Z.ai podaje odsetek błędnych znaków na poziomie 0,0717 i deklaruje wyrównanie z najlepszymi systemami mowy na świecie. Najmocniejszym argumentem jest zasięg językowy. Poza mandaryńskim i angielskim w odmianie amerykańskiej i brytyjskiej model dostrojono do syczuańskiego, kantońskiego, min nan i wu, a obsługuje kilkadziesiąt innych języków, w tym francuski, niemiecki, japoński, koreański, hiszpański i arabski. Przyjmuje też własny słownik: nazwy kodowe projektów, nazwy leków, rzadkie nazwiska i nazwy miejscowości można wgrać raz w zapytaniu, zamiast poprawiać je potem w każdej transkrypcji. Przy mowie mieszanej chińsko-angielskiej — czyli zwykłym rejestrze narady inżynierskiej w Shenzhenie — producent deklaruje wyraźną przewagę nad konkurencją. Ograniczenie wymaga w tym profilu jasnego postawienia sprawy, bo dwie strony samego producenta przeczą sobie nawzajem. Karta modelu reklamuje sześć zastosowań, a trzy pierwsze to protokoły z zebrań na żywo, napisy do transmisji wideo i dyktowanie dokumentacji medycznej. Dokumentacja API tego samego modelu podaje twarde limity: plik do 25 MB i nagranie do 30 sekund na jedno wywołanie. Ten pułap obowiązuje również w trybie strumieniowym — strumieniowanie oznacza tu, że tekst wraca stopniowo, a nie że dźwięk można podawać w sposób ciągły. Zebrania, transmisji ani podyktowanego wywiadu lekarskiego nie da się wysłać na tę końcówkę w całości; wywołujący musi pociąć nagranie na półminutowe fragmenty i pozszywać wyniki, tracąc na każdym szwie kontekst zdania i ciągłość mówiącego. Dokumentacja nie proponuje żadnej ścieżki dla nagrań długich. Zostaje więc model dobrze wyceniony i naprawdę wielojęzyczny, o kształcie pasującym do krótkich wypowiedzi: wprowadzanie głosem w aplikacji, polecenie, pojedyncze pytanie, jedna tura rozmowy z obsługą klienta. Kto transkrybuje godzinne nagranie, uzna za praktyczniejsze otwarte rodzeństwo — na licencji MIT, chodzące na własnym sprzęcie bez żadnego limitu długości na wywołanie. To nietypowa rzecz do napisania o darmowym modelu konkurującym z płatnym z tej samej firmy.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!