MDL-2920EST.2025 · IDX.408
Model językowyW produkcji

Gemini 2.0 Flash

Google DeepMind · United States · 2025

Tani koń roboczy Google, który widział i mówił w czasie rzeczywistym — model, dzięki któremu strumień dźwięku i obrazu stał się zwykłym wywołaniem API.

Ocena wujec.ai

8.4/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Gemini 2.0 Flash zapowiedziano 11 grudnia 2024 roku jako wydanie eksperymentalne, a pełną dostępność uzyskał 5 lutego 2025. Google przedstawiało go jako otwarcie ery agentowej, ale jego trwały wkład był bardziej namacalny: uczynił multimodalność w czasie rzeczywistym tanią i zwyczajną. Dzięki interfejsowi Multimodal Live API programista mógł przesyłać do modelu strumień dźwięku i obrazu i otrzymywać mówione odpowiedzi z niewielkim opóźnieniem, więc aplikacja mogła patrzeć w obraz z kamery i rozmawiać o tym, co widzi. Model generował też natywnie obrazy i mowę w wielu językach, zamiast oddawać te zadania osobnym systemom. Natywne użycie narzędzi — wyszukiwarki Google, wykonywania kodu i funkcji definiowanych przez użytkownika — było wbudowane, a nie doklejone. Drugą połową tej historii była ekonomia. Przy cenie około 0,10 dolara za milion tokenów wejścia i 0,40 dolara za milion wyjścia, z oknem kontekstu rzędu miliona tokenów, Flash był na tyle tani, że mógł siedzieć wewnątrz produktów o dużym ruchu — i stał się domyślnym modelem Google w aplikacji Gemini oraz w znacznej części pakietu Workspace. Google podawało, że wypada lepiej niż model Pro poprzedniej generacji, działając przy tym mniej więcej dwa razy szybciej. Model został już wycofany. Harmonogram deprecacji Google wyznaczył 1 czerwca 2026 jako datę wyłączenia identyfikatorów gemini-2.0-flash i gemini-2.0-flash-001, ze wskazanym zamiennikiem gemini-3.6-flash; ta data już minęła i zapytania do modeli 2.0 Flash nie działają.

#historic#multimodal#realtime#retired
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję