Biznes19.08.2026 · OpenAI — dokumentacja modeli i lista wycofań (platform.openai.com)Ceny modeli głosowych OpenAI spadły przez 22 miesiące tylko raz — a tekst na wyjściu w tym czasie podrożał
OpenAI powiadomiło programistów, że dziewięć starszych modeli głosowych — cała linia GPT-4o audio i realtime oraz pierwsza generacja GPT-Audio i GPT-Realtime — przestanie odpowiadać 20 stycznia 2027 roku. Uzupełnienie naszego katalogu o cztery brakujące profile głosowych GPT-4o zebrało w jednym miejscu całą historię cen tej linii, a czyta się ją inaczej niż historię cen tekstu.
Gdy 1 października 2024 roku ruszyły GPT-4o Audio i GPT-4o Realtime, token dźwiękowy kosztował 40 USD za milion na wejściu i 80 USD na wyjściu. W sierpniu 2025 następcy, GPT-Audio i GPT-Realtime, zeszli do 32 i 64 USD. Dzisiejsze modele ogólnie dostępne — gpt-audio-1.5 i gpt-realtime-2.1, czyli te, które OpenAI wskazuje w zawiadomieniu o wyłączeniu — liczą dokładnie te same 32 i 64 USD. To jedna obniżka, o 20%, w dwadzieścia dwa miesiące i nic więcej.
Tekst w tych samych modelach poszedł w dwie strony naraz. W linii czasu rzeczywistego wejście stopniało z 5 do 4 USD za milion, a wejście z pamięci podręcznej runęło z 2,50 do 0,40 USD, czyli o 84%. Wyjście zdrożało: 20 USD w 2024 roku, dziś 24 USD — o jedną piątą więcej. Proporcja, która najbardziej obchodzi budujących produkty głosowe, nie drgnęła w ogóle. W październiku 2024 token dźwięku na wejściu kosztował osiem razy tyle co token tekstu; w sierpniu 2026, przy 32 USD wobec 4 USD, kosztuje dokładnie tyle samo razy więcej.
Za te same pieniądze klient dostał za to miejsce. GPT-4o Realtime pamiętał 32 tysiące tokenów i odpowiadał najwyżej 4096; gpt-realtime-2.1 mieści 128 tysięcy i oddaje do 32 tysięcy — czterokrotnie większy kontekst i ośmiokrotnie dłuższa odpowiedź przy niezmienionej stawce za dźwięk. Tania półka mówi to samo od dołu: GPT-4o mini Realtime, udostępniony 17 grudnia 2024 roku, miał najkrótszą pamięć w rodzinie, 16 tysięcy tokenów.
Jedno zastrzeżenie: to ceny katalogowe z kart modeli OpenAI, a nie to, co płaci konkretny klient, a tokenów dźwiękowych nie da się wprost porównywać z tekstowymi — sekunda mowy zużywa ich znacznie więcej niż sekunda czytania. Porównanie dotyczy wyłącznie OpenAI z samym sobą, jednej generacji głosowej z następną.
GPT-4o Realtime →