Universal-2
AssemblyAI · USA · 2024
Starszy i tańszy model transkrypcji AssemblyAI, który obejmuje pięć razy więcej języków niż flagowiec, który go zastąpił.
Universal-2 to model rozpoznawania mowy poprzedniej generacji firmy AssemblyAI, ogłoszony pod koniec października 2024 roku i wciąż sprzedawany obok flagowca z 2026 roku, a nie wycofany za nim. To rzadki przypadek, w którym starszy model jest szerszy od swojego następcy: zapisuje ponad 99 języków, podczas gdy Universal-3.5 Pro obejmuje 18, i kosztuje 0,15 dolara za godzinę nagrania wobec 0,21 u flagowca. Deklarowanym celem projektowym nie była surowa dokładność słowna, lecz te fragmenty transkrypcji, które czytelnik naprawdę zauważa, gdy są błędne: nazwiska, liczby i formatowanie. We własnym zestawieniu producenta model notuje 13,87% błędu Jaro-Winklera na nazwach własnych, 10,06% błędu słów przy formatowaniu tekstu i 4,00% na ciągach alfanumerycznych — wyniki, które firma stawia przed ówczesnymi wersjami Deepgram Nova-2, OpenAI Whisper Large-v3, Microsoft Azure Batch v3.1, Amazona i Google Latest-long we wszystkich trzech miarach poza alfanumeryką, gdzie Whisper wypada nieznacznie lepiej. Są to pomiary producenta dotyczące konkurencji i tak należy je czytać. Universal-2 obsługuje też przełączanie języków oraz podpowiedź terminologiczną: wywołujący podaje do 200 słów z dziedziny — nazwy produktów, nazwy leków, nazwiska — których model ma się spodziewać. AssemblyAI ustawia go dziś wprost jako rozwiązanie zapasowe dla języków, których flagowiec nie obejmuje, i jako wybór do masowej, wrażliwej cenowo pracy wsadowej. Kompromis, przed którym stawia się kupującego, producent nazywa otwarcie: nowszy i ostrzejszy na osiemnastu językach albo starszy, tańszy i wystarczający na dziewięćdziesięciu dziewięciu.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!