GPT Transcribe
OpenAI · USA · 2026
Zalecany przez OpenAI model transkrypcji od lipca 2026 — o ćwierć tańszy za minutę od Whispera, którego zastępuje, choć nie przejął wszystkiego, co Whisper potrafi.
GPT Transcribe, wydany 28 lipca 2026 roku razem z GPT Live Transcribe, to model, do którego OpenAI kieruje dziś programistów w pierwszej kolejności, gdy trzeba zamienić mowę na tekst. Pracuje na gotowych nagraniach przez końcówkę transkrypcji dźwięku, a w sesji czasu rzeczywistego przygotowuje przez WebSocket ostateczny zapis zatwierdzonej tury rozmowy. Rozlicza się nie za tokeny, lecz za czas nagrania: 0,0045 USD za minutę, czyli o ćwierć mniej niż 0,006 USD pobierane za whisper-1 i gpt-4o-transcribe. Od poprzedniej generacji odróżnia go to, ile wolno mu powiedzieć z góry. Przyjmuje swobodny opis nagrania, listę podpowiedzi słownych — nazwisk, nazw produktów, skrótów, które inaczej przekręci — oraz, co ważniejsze, listę spodziewanych języków zamiast jednego. Starsze modele przyjmują pojedyncze pole języka i zakładają jedną mowę na plik; ten przyjmuje pole `languages` i jest zrobiony pod nagrania, w których język zmienia się w połowie zdania. W sesji czasu rzeczywistego sam dokłada sobie do kontekstu wcześniej przepisane tury. Tekst może płynąć strumieniem, jeszcze zanim plik zostanie przetworzony w całości. Trzy rzeczy nie przeszły do nowego modelu i OpenAI pisze o tym wprost we własnym przewodniku: znaczniki czasu dla poszczególnych słów oraz napisy srt i vtt zostały przy whisper-1, zapis z podziałem na mówiących wymaga gpt-4o-transcribe-diarize, a przetłumaczenie nagrania na angielski to nadal zadanie dla whisper-1. Starsze modele transkrypcji działają dalej dla istniejących wdrożeń, ale nie są już zalecanym punktem wyjścia.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!