Gemini 2.0 Flash
Google DeepMind · United States · 2025
Tani koń roboczy Google, który widział i mówił w czasie rzeczywistym — model, dzięki któremu strumień dźwięku i obrazu stał się zwykłym wywołaniem API.
Gemini 2.0 Flash zapowiedziano 11 grudnia 2024 roku jako wydanie eksperymentalne, a pełną dostępność uzyskał 5 lutego 2025. Google przedstawiało go jako otwarcie ery agentowej, ale jego trwały wkład był bardziej namacalny: uczynił multimodalność w czasie rzeczywistym tanią i zwyczajną. Dzięki interfejsowi Multimodal Live API programista mógł przesyłać do modelu strumień dźwięku i obrazu i otrzymywać mówione odpowiedzi z niewielkim opóźnieniem, więc aplikacja mogła patrzeć w obraz z kamery i rozmawiać o tym, co widzi. Model generował też natywnie obrazy i mowę w wielu językach, zamiast oddawać te zadania osobnym systemom. Natywne użycie narzędzi — wyszukiwarki Google, wykonywania kodu i funkcji definiowanych przez użytkownika — było wbudowane, a nie doklejone. Drugą połową tej historii była ekonomia. Przy cenie około 0,10 dolara za milion tokenów wejścia i 0,40 dolara za milion wyjścia, z oknem kontekstu rzędu miliona tokenów, Flash był na tyle tani, że mógł siedzieć wewnątrz produktów o dużym ruchu — i stał się domyślnym modelem Google w aplikacji Gemini oraz w znacznej części pakietu Workspace. Google podawało, że wypada lepiej niż model Pro poprzedniej generacji, działając przy tym mniej więcej dwa razy szybciej. Model został już wycofany. Harmonogram deprecacji Google wyznaczył 1 czerwca 2026 jako datę wyłączenia identyfikatorów gemini-2.0-flash i gemini-2.0-flash-001, ze wskazanym zamiennikiem gemini-3.6-flash; ta data już minęła i zapytania do modeli 2.0 Flash nie działają.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!