Gemini 1.5 Pro
Google DeepMind · United States · 2024
Model, który zrobił z długości kontekstu główny argument sprzedażowy — milion tokenów, potem dwa, gdy konkurencja stała przy 128 tysiącach.
Gemini 1.5 Pro, ogłoszony 15 lutego 2024 roku, uczynił z długości kontekstu pole rywalizacji. Gdy reszta branży zatrzymała się na 128 000 tokenów, Google udostępniło standardowe okno tej samej wielkości, ale z wersją zapoznawczą sięgającą miliona tokenów — a na konferencji Google I/O w maju 2024 podniosło je do dwóch milionów. Milion tokenów to mniej więcej godzina wideo, jedenaście godzin nagrania dźwiękowego, trzydzieści tysięcy wierszy kodu albo bardzo obszerna powieść, mieszczące się w jednym zapytaniu, bez sztuczek z wyszukiwaniem fragmentów. Google ujawniło też to, czego wiele laboratoriów nie ujawniało: model jest rzadką mieszanką ekspertów (mixture of experts), i właśnie dzięki temu dorównywał jakością znacznie większemu Gemini 1.0 Ultra przy istotnie mniejszym nakładzie obliczeń. W testach wyszukiwania „igły w stogu siana" odnajdywał konkretne fakty w tak ogromnych wejściach z wysoką niezawodnością, a raport techniczny opisywał, jak model uczy się tłumaczyć język kalamang — którym mówi mniej niż 200 osób i którego niemal nie ma w danych treningowych — wyłącznie na podstawie podręcznika gramatyki umieszczonego w zapytaniu. Model był multimodalny w praktycznym sensie: tekst, obrazy, dźwięk i wideo można było mieszać w jednym zapytaniu, co czyniło go pierwszym flagowcem naprawdę przydatnym do analizy nagrań i materiału filmowego, a nie tylko pojedynczych zdjęć. Po nim przyszedł Gemini 1.5 Flash — szybszy i tańszy wariant destylowany — a całą linię zastąpiła rodzina Gemini 2.0 pod koniec 2024 roku. Wycofywanie Gemini 1.5 Pro z nowych projektów w API Google rozpoczęło w kwietniu 2025. Jego trwały ślad widać w tym, że duże okno kontekstu jest dziś standardowym oczekiwaniem, a nie wyróżnikiem.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!