Gemini 3.1 Flash Live
Google DeepMind · USA · 2026
Odpowiedź Google na rozmowę na żywo — dźwięk na wejściu, dźwięk na wyjściu, bez transkrypcji po drodze.
Gemini 3.1 Flash Live to obecny model konwersacyjny Google o niskim opóźnieniu, udostępniany przez Live API jako dwukierunkowy strumień dźwięku. Założenie, które dzieli z realtime'ową linią OpenAI, to natywny dźwięk: model słyszy dźwięk i wytwarza dźwięk bezpośrednio, zamiast przechodzić przez etap zamiany mowy na tekst, który gubi ton, tempo i wejście w słowo. Poza głosem przyjmuje też obraz i wideo, więc to on stoi za asystentami z kamerą, komentującymi to, co im się pokaże. Ostro różni się od amerykańskiego rywala ceną — trzy dolary za milion tokenów dźwięku wejściowego i dwanaście za milion wyjściowego, czyli mniej więcej pół centa i niecałe dwa centy za minutę, o rząd wielkości taniej niż GPT-Realtime-2. Jest udostępniony jako publiczna zapowiedź i bezpłatny w darmowym progu Google, co w praktyce znaczy, że może go użyć każdy, ale Google zastrzega sobie prawo do zmian. Jego produkcyjny poprzednik, model natywnego dźwięku z linii 2.5 Flash z grudnia 2025 roku, pozostaje dostępny dla zastosowań wymagających stabilności.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!