MDL-8077EST.2026 · IDX.678
AudioW produkcji

GPT-Realtime-Whisper

OpenAI · USA · 2026

Marka Whisper przerobiona na żywo — słowa na ekranie, gdy mówca jeszcze mówi.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

GPT-Realtime-Whisper, opublikowany 7 maja 2026 roku, przywraca najbardziej znaną dźwiękową markę OpenAI do zupełnie innego zadania. Pierwotny Whisper był modelem wsadowym: podawało mu się gotowe nagranie i czekało. Ten transkrybuje strumień na żywo i pozwala programiście wybrać punkt między opóźnieniem a dokładnością — napis, który pojawia się natychmiast i chwilę później zostaje poprawiony, albo wolniejszy, który przychodzi już właściwy. Rozliczany jest od czasu: 1,7 centa za minutę nagrania, czyli o połowę taniej niż model tłumaczący z tej samej rodziny, i działa wyłącznie na punkcie końcowym transkrypcji w czasie rzeczywistym. Kontekst jest celowo mały, 16 tysięcy tokenów przy pułapie 2000 tokenów wyjścia, bo transkrypcja na żywo nie musi pamiętać wiele. Uwaga: otwartowagowy Whisper large-v3 nie został ani zastąpiony, ani wycofany — pozostaje darmową opcją do samodzielnego uruchomienia dla nagrań już zakończonych.

#speech recognition#transcription#streaming#realtime#api only
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję