MDL-7872EST.2023 · IDX.239
AudioW produkcji

Whisper large-v3

OpenAI · USA · 2023

Open-source'owe ucho ery AI — rozpoznawanie mowy w 100 językach, wszędzie.

Ocena wujec.ai

8.4/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Whisper to otwarty model rozpoznawania mowy od OpenAI, odporny na akcenty, hałas i słownictwo techniczne w około 100 językach. Wydany na licencji MIT stał się domyślnym silnikiem transkrypcji internetu — wbudowanym w narzędzia do spotkań, potoki napisów, asystentów głosowych i systemy słuchania niezliczonych robotów. Ten profil opisuje dwie rzeczy, które łatwo pomylić. Pierwsza to wagi: openai/whisper-large-v3, na licencji MIT, do pobrania przez każdego i nie do odebrania nikomu, kto już je ma. Druga to whisper-1, czyli hostowana końcówka, którą OpenAI sprzedaje we własnym API po 0,006 USD za minutę. 26 sierpnia 2026 roku firma wpisała tę końcówkę na listę wycofań z datą usunięcia 26 lutego 2027, razem z trzema modelami transkrypcji z rodziny GPT-4o; jako zastępstwo wskazała gpt-transcribe i gpt-live-transcribe. Kłopotliwe jest to, że firmowy przewodnik po transkrypcji na 3 września 2026 roku wciąż kieruje do whisper-1 w trzech sprawach: znaczników czasu dla pojedynczych słów, napisów w formatach srt i vtt oraz tłumaczenia nagrania na angielski. Zalecani następcy tego nie potrafią. Kto robi napisy przez OpenAI, jest więc odesłany do modelu z ogłoszoną datą wyłączenia i bez równorzędnego zastępstwa wewnątrz platformy — choć tę samą pracę można bezterminowo wykonywać na otwartych wagach, na własnym sprzęcie, za cenę prądu.

#speech recognition#open source#multilingual#transcription
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję