Wszystkie newsyPremiery

Z.ai sprzedaje model mowy do protokołów z zebrań i napisów na żywo. API przyjmuje 30 sekund nagrania.

Opublikowano: 3.09.2026 · Źródło: Z.ai developer documentation

Dwie strony własnej dokumentacji Z.ai, sprawdzone 3 września 2026 roku, opisują ten sam model rozpoznawania mowy w sposób, którego nie da się zrealizować jednocześnie. Karta modelu GLM-ASR-2512 wymienia sześć zastosowań. Pierwsze to protokoły z zebrań na żywo — „transkrybuj spotkania online natychmiast, automatycznie porządkując ustrukturyzowane podsumowania". Trzecie to napisy na żywo do transmisji informacyjnych, kursów i wideokonferencji. Szóste to wprowadzanie dokumentacji medycznej: lekarz dyktuje wywiad, model go zapisuje. Dokumentacja API tego samego modelu podaje pułap: obsługiwane formaty .wav i .mp3, plik do 25 MB, nagranie do 30 sekund. Na jedno wywołanie. Limit nie jest skutkiem ubocznym trybu bez strumieniowania. Z.ai dokumentuje dla tej końcówki tryb strumieniowy i obowiązuje w nim ta sama specyfikacja. Strumieniowanie oznacza tu, że transkrypcja wraca stopniowo w trakcie pracy modelu — a nie że dźwięk można podawać w sposób ciągły. Nie ma osobnej końcówki dla nagrań długich, nie ma zadania asynchronicznego dla pliku, nie ma udokumentowanego sposobu na przekazanie godziny materiału. Wywołującemu zostaje arytmetyka. Godzinne zebranie to 120 osobnych zapytań, każde ucięte na sztywnej granicy pół minuty, która wypada tam, gdzie wypadnie: w środku słowa, w środku zdania, w środku nazwiska. Każdy szew jest miejscem utraty kontekstu i miejscem, w którym trzeba na nowo podać własny słownik — czyli jedną z rzeczywistych zalet tego modelu. Ciągłość mówiących na złączeniach to już problem wywołującego, nie modelu. Nic z tego nie czyni GLM-ASR-2512 modelem słabym. Z.ai podaje odsetek błędnych znaków 0,0717, zasięg językowy jest jak na tę cenę nietypowo szeroki — syczuański, kantoński, min nan i wu obok mandaryńskiego, angielskiego i kilkudziesięciu innych języków — a przy około 0,0024 USD za minutę model jest mniej więcej o połowę tańszy od polecanego dziś przez OpenAI. Do krótkich wypowiedzi, wprowadzania głosem, poleceń i pojedynczych tur rozmowy z obsługą klienta kształt pasuje. Nie pasują reklamowane zastosowania, a różnicę warto nazwać ze względu na to, kogo ona dotyka. Programista czytający kartę modelu widzi transkrypcję zebrań obiecaną w pierwszym wierszu, a na ścianę trzydziestu sekund trafia dopiero po napisaniu integracji. Jest tu zakończenie nietypowe dla produktu płatnego. Z.ai opublikowało tego samego dnia otwarte rodzeństwo, GLM-ASR-Nano-2512: 1,5 miliarda parametrów, licencja MIT, za darmo do pobrania i — ponieważ chodzi na sprzęcie wywołującego — bez żadnego limitu długości na wywołanie. Trzy długie zastosowania, które producent reklamuje, potrafi wykonać akurat model darmowy.