GPT-Realtime-Whisper
OpenAI · USA · 2026
Marka Whisper przerobiona na żywo — słowa na ekranie, gdy mówca jeszcze mówi.
GPT-Realtime-Whisper, opublikowany 7 maja 2026 roku, przywraca najbardziej znaną dźwiękową markę OpenAI do zupełnie innego zadania. Pierwotny Whisper był modelem wsadowym: podawało mu się gotowe nagranie i czekało. Ten transkrybuje strumień na żywo i pozwala programiście wybrać punkt między opóźnieniem a dokładnością — napis, który pojawia się natychmiast i chwilę później zostaje poprawiony, albo wolniejszy, który przychodzi już właściwy. Rozliczany jest od czasu: 1,7 centa za minutę nagrania, czyli o połowę taniej niż model tłumaczący z tej samej rodziny, i działa wyłącznie na punkcie końcowym transkrypcji w czasie rzeczywistym. Kontekst jest celowo mały, 16 tysięcy tokenów przy pułapie 2000 tokenów wyjścia, bo transkrypcja na żywo nie musi pamiętać wiele. Uwaga: otwartowagowy Whisper large-v3 nie został ani zastąpiony, ani wycofany — pozostaje darmową opcją do samodzielnego uruchomienia dla nagrań już zakończonych.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!