GPT-Realtime-2
OpenAI · USA · 2026
Głos, który myśli, zanim odpowie — rozumowanie klasy GPT-5 w rozmowie na żywo.
GPT-Realtime-2, ogłoszony 7 maja 2026 roku, to najmocniejszy model mowa-w-mowę OpenAI i pierwszy głosowy model firmy opisywany jako rozumujący na poziomie tekstowej linii GPT-5. Wcześniejsze modele głosowe były szybkie, ale płytkie: odpowiadały błyskawicznie, bo prawie nie myślały. Ten ma regulowany nakład rozumowania, więc programista może wymieniać opóźnienie na głębię przy każdym zapytaniu z osobna, a w trakcie pracy podtrzymuje rozmowę zamiast milknąć. Na wejściu przyjmuje tekst, dźwięk i obraz, na wyjściu mówi i pisze, mieści 128 tysięcy tokenów kontekstu i wywołuje narzędzia równolegle. Ceną są koszt i zamknięty zakres: dźwięk kosztuje 32 dolary za milion tokenów wejścia i 64 za milion wyjścia, a model działa wyłącznie na punkcie końcowym Realtime — nie da się go użyć przez chat completions, tryb wsadowy ani API asystentów. Jego wiedza kończy się 30 września 2024 roku, więc wszystko nowsze musi dotrzeć przez narzędzia.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!