Universal-3.5 Pro
AssemblyAI · USA · 2026
Model transkrypcji, który rozstrzyga, kto mówi, w tym samym przebiegu, w którym rozstrzyga, co zostało powiedziane — i zmienia język w środku zdania bez uprzedzenia.
Universal-3.5 Pro to flagowy model rozpoznawania mowy firmy AssemblyAI, udostępniony 29 czerwca 2026 roku dla nagrań, a w wariancie strumieniowym także do transkrypcji na żywo i do firmowego interfejsu agentów głosowych. Od 2 września 2026 roku staje się modelem domyślnym dla kont, które nie wskazują wersji wprost, a poprzednia linia Universal-3 Pro zostaje wycofana. Najważniejsza decyzja projektowa jest ta, że przypisanie wypowiedzi do mówcy nie jest osobnym systemem. Klasyczne rozwiązania prowadzą transkrypcję i rozdzielanie mówców niezależnie, a potem zszywają oba wyniki po znacznikach czasu — co rozpada się przy krótkich wymianach zdań, wchodzeniu sobie w słowo i nakładających się głosach. Universal-3.5 Pro wydaje tekst i zmiany mówcy z jednego przebiegu, więc szybka wymiana zdań między dwiema osobami pozostaje szybką wymianą zdań, a nie jednym blokiem przypisanym komuś po fakcie. Druga zmiana to przełączanie języków. Osiemnaście języków jest obsługiwanych z pełną dokładnością — tak nazywa to producent — a zdanie może między nimi przechodzić bez żadnej konfiguracji: rozmowa po angielsku i w hindi albo po angielsku i po mandaryńsku jest zapisywana w języku, w którym każde słowo naprawdę padło, zamiast być sprowadzana do jednego. We własnym teście producenta model osiąga średni wskaźnik błędu na poziomie 7,69% dla pięciu par językowych; ten sam test stawia kilka modeli konkurencji powyżej 10%, a dwa powyżej 35%. Są to pomiary producenta dotyczące jego rywali i tak należy je czytać. Trzecia nowość to podpowiedź kontekstowa: wywołujący może podać modelowi akapit kontekstu — wcześniejszą notatkę lekarską, agendę spotkania, listę nazw produktów — a model używa go do rozstrzygania niejednoznaczności. AssemblyAI podaje, że w wewnętrznym teście medycznym dołączenie notatki z poprzedniej wizyty zmniejszyło liczbę przeoczonych terminów medycznych o 31%. Rozliczenie jest za godzinę, nie za tokeny: 0,21 USD za godzinę nagrania i 0,45 USD za godzinę otwartej sesji przy transkrypcji strumieniowej, przy czym cisza i bezczynność również są płatne. Starszy Universal-2 zostaje w ofercie po 0,15 USD za godzinę i obejmuje 99 języków zamiast 18 — producent mówi o tym kompromisie wprost.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!