GPT-4o Transcribe Diarize
OpenAI · USA · 2025
Jedyny model OpenAI, który mówi, kto powiedział. Ta jedna umiejętność trzyma go w służbie, choć producent poleca dziś tańszy model, który jej nie ma.
GPT-4o Transcribe Diarize to model zamiany mowy na tekst z wbudowanym rozpoznawaniem mówiących: nie zapisuje po prostu tego, co padło, lecz dzieli zapis według tego, kto to powiedział, zwracając odpowiedź w formacie diarized_json z etykietami mówiących oraz czasem początku i końca każdego fragmentu. Trafił do Audio API pod koniec października 2025 i jest dostępny wyłącznie przez końcówkę transkrypcji — bez chat completions, bez asystentów, bez trybu wsadowego i dostrajania. Technicznie to najwęższy członek dźwiękowej rodziny 4o: 16 tysięcy tokenów kontekstu, 2 tysiące tokenów wyjścia, wiedza do 1 czerwca 2024 roku. Kosztuje 2,50 USD za milion tokenów wejściowych i 10 USD za milion wyjściowych, co daje mniej więcej 0,006 USD za minutę nagrania — tyle samo, ile zwykły gpt-4o-transcribe i whisper-1. Jego położenie zmieniło się w lipcu 2026 roku, choć sam model nie zmienił się wcale. OpenAI wydało GPT Transcribe za 0,0045 USD za minutę i uczyniło go zalecanym punktem wyjścia, a modele transkrypcyjne z rodziny 4o opisało jako dobre dla istniejących wdrożeń, ale nie do zaczynania od nich. Podział na mówiących nigdzie się jednak nie przeniósł: firmowy przewodnik po transkrypcji nadal odsyła do tego modelu każdego, kto musi wiedzieć, kto mówił. Zebrania, wywiady, nagrania z infolinii i wszystko, co ma trafić do protokołu, chodzą więc na modelu droższym o jedną trzecią od zalecanego i pozbawionym rekomendacji. W sierpniu 2026 roku nie figuruje on na żadnej liście wycofań.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!