MDL-4618EST.2025 · IDX.711
AudioW produkcji

GPT-4o Transcribe

OpenAI · USA · 2025

Pierwszy model transkrypcji OpenAI zbudowany na GPT, wydany w marcu 2025, żeby pobić Whispera dokładnością. Nadal sprzedawany, ale już niezalecany — i jako jedyny w rodzinie nie ma ani jednej datowanej wersji.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

GPT-4o Transcribe, wydany 20 marca 2025 roku, był pierwszą próbą zastąpienia Whispera przez OpenAI modelem transkrypcji zbudowanym na flagowej linii multimodalnej. Argumentem miała być dokładność: niższy odsetek błędnie rozpoznanych słów i lepsze rozpoznawanie języka niż w pierwotnych modelach Whisper, przy tej samej końcówce, z której programiści już korzystali. Przyjmuje dźwięk i tekst, zwraca wyłącznie tekst, ma okno kontekstu 16 000 tokenów i do 2 000 tokenów odpowiedzi; wiedza modelu kończy się 1 czerwca 2024 roku. Rozliczenie da się czytać na dwa sposoby i warto o tym wiedzieć przed porównywaniem go z czymkolwiek. Stawka tokenowa to 2,50 USD za milion tokenów dźwięku na wejściu i 10 USD za milion tokenów tekstu na wyjściu; to samo użycie wyrażone długością nagrania kosztuje 0,006 USD za minutę — dokładnie tyle, ile OpenAI liczy za whisper-1, czyli za model, który ten miał zastąpić. Od 28 lipca 2026 zalecanym punktem wyjścia jest GPT Transcribe za 0,0045 USD za minutę, a tańsze rodzeństwo tego modelu, GPT-4o mini Transcribe, kosztuje 0,003 USD za minutę. GPT-4o Transcribe stoi więc w niewygodnym środku: nie jest ani dokładnym ustawieniem domyślnym, ani wariantem tanim. Jeden szczegół odróżnia go od wszystkich pozostałych modeli transkrypcji OpenAI i nie działa na jego korzyść. Lista wersji zawiera jedną pozycję — sam alias `gpt-4o-transcribe`, bez żadnej daty. Tańsza odmiana mini ma dwie datowane wersje i pozwala klientowi przypiąć się do wybranej; droższy o połowę model z tej samej pary — nie. Kto potrzebuje zamrożonej, dającej się skontrolować wersji tego, za co płaci, tutaj jej nie dostanie. Na sierpień 2026 OpenAI nie ogłosiło daty wyłączenia modelu; jest nadal dostępny przez końcówkę transkrypcji dźwięku i wewnątrz sesji czasu rzeczywistego.

#audio#speech-to-text#transcription#api only#multilingual
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję