GPT-4o Realtime
OpenAI · USA · 2024
Model pierwszego głosowego API na żywo: mówi przez WebRTC, można mu wejść w słowo — i pamięta z rozmowy tylko 32 tysiące tokenów.
GPT-4o Realtime, udostępniony razem z Realtime API 1 października 2024 roku, sprawił, że rozmowa z maszyną zaczęła przypominać telefon, a nie wymianę nagrań. Model trzyma otwarte połączenie przez WebRTC albo WebSocket, zaczyna mówić, zanim zdanie się skończy, i milknie, gdy człowiek wejdzie mu w słowo. Za tę natychmiastowość płaci się pamięcią: mieści 32 tysiące tokenów kontekstu i oddaje najwyżej 4096 — po jednej czwartej tego, co turowy bliźniak GPT-4o Audio — a tokeny dźwiękowe kosztują dokładnie tyle samo, 40 USD na wejściu i 80 na wyjściu za milion. Tekst to 5 i 20 USD, wejście z pamięci podręcznej 2,50 USD. Na wejściu i wyjściu przyjmuje tekst i dźwięk, wiedza kończy się 1 października 2023 roku, a model nigdy nie wyszedł z fazy zapoznawczej. OpenAI ogłosiło wycofanie 20 lipca 2026; milknie 20 stycznia 2027, a zastępuje go gpt-realtime-2.1.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!