GPT-4o Audio, dostępny od 1 października 2024 roku, był pierwszym modelem OpenAI, który przyjmował plik dźwiękowy i odpowiadał mową przez ten sam punkt chat completions, którego programiści używali już do tekstu — bez nowego protokołu i bez otwartego połączenia. Czyta tekst i dźwięk, odpowiada tekstem i dźwiękiem, mieści 128 tysięcy tokenów kontekstu, oddaje do 16 384, a jego wiedza kończy się 1 października 2023 roku. Nigdy nie wyszedł z fazy zapoznawczej: identyfikator modelu wciąż kończy się na -preview, a domyślna migawka nosi datę 3 czerwca 2025. Drogi jest dźwięk — 40 USD za milion tokenów na wejściu i 80 na wyjściu, czyli szesnaście i osiem razy więcej niż tekst w tym samym modelu. 20 lipca 2026 roku OpenAI wpisało całą starszą rodzinę głosową na listę wycofań; GPT-4o Audio przestaje odpowiadać 20 stycznia 2027, a następcą wskazano gpt-audio-1.5.