MDL-6765EST.2026 · IDX.257
AudioW produkcji

GPT-Realtime-2

OpenAI · USA · 2026

Głos, który myśli, zanim odpowie — rozumowanie klasy GPT-5 w rozmowie na żywo.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

GPT-Realtime-2, ogłoszony 7 maja 2026 roku, to najmocniejszy model mowa-w-mowę OpenAI i pierwszy głosowy model firmy opisywany jako rozumujący na poziomie tekstowej linii GPT-5. Wcześniejsze modele głosowe były szybkie, ale płytkie: odpowiadały błyskawicznie, bo prawie nie myślały. Ten ma regulowany nakład rozumowania, więc programista może wymieniać opóźnienie na głębię przy każdym zapytaniu z osobna, a w trakcie pracy podtrzymuje rozmowę zamiast milknąć. Na wejściu przyjmuje tekst, dźwięk i obraz, na wyjściu mówi i pisze, mieści 128 tysięcy tokenów kontekstu i wywołuje narzędzia równolegle. Ceną są koszt i zamknięty zakres: dźwięk kosztuje 32 dolary za milion tokenów wejścia i 64 za milion wyjścia, a model działa wyłącznie na punkcie końcowym Realtime — nie da się go użyć przez chat completions, tryb wsadowy ani API asystentów. Jego wiedza kończy się 30 września 2024 roku, więc wszystko nowsze musi dotrzeć przez narzędzia.

#speech to speech#voice agents#realtime#reasoning#api only
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję