MDL-5381EST.2024 · IDX.421
category.visionW produkcji

PaliGemma

Google · USA · 2024

Pierwszy otwarty model wizyjno-językowy Google: baza o 3 miliardach parametrów stworzona do dostrajania, wydana z pięćdziesięcioma czterema gotowymi punktami kontrolnymi do poszczególnych testów — i wciąż najczęściej pobierany model swojej linii.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

PaliGemma to pierwszy model wizyjno-językowy w rodzinie Gemma, ogłoszony na Google I/O 14 maja 2024. Architektonicznie jest to świadomie prosty przepis: koder obrazu SigLIP-So400m podający dane do modelu językowego Gemma 2B, podejście zaczerpnięte z wcześniejszego PaLI-3 Google. Plik wag liczy 2,92 miliarda parametrów. Obraz wchodzi w jednej z trzech rozdzielczości — 224, 448 albo 896 pikseli kwadratowych — a model odpowiada tekstem: podpisy do zdjęć i krótkich filmów, odpowiadanie na pytania o obraz, czytanie tekstu wewnątrz fotografii, wykrywanie obiektów i segmentacja. Nietypowe w tym wydaniu jest nie tyle sam model, ile to, co Google opublikował wokół niego. PaliGemma nigdy nie miała służyć do użytku wprost z pudełka; to baza do przeniesienia na własne zadanie, a towarzyszący raport techniczny ocenia ją na prawie czterdziestu zadaniach. Firma wydała więc trzy rodzaje punktów kontrolnych: wstępnie nauczone (pt) do dostrajania, jeden mieszany (mix) do wypróbowania modelu oraz pięćdziesiąt cztery punkty kontrolne pod konkretne zadania (ft) — osobne wagi dla podpisów COCO, DocVQA, TextVQA, ScienceQA, pytań o zdjęcia satelitarne, opisu ekranu, segmentacji i innych. Wag pod pojedyncze testy nie publikuje prawie nikt inny, a chodzi o powtarzalność: badacz może sprawdzić podaną przez Google liczbę, zamiast brać ją na wiarę. Zastrzeżenie dotyczy licencji. W odróżnieniu od Gemmy 4 czy SigLIP 2, które są na Apache 2.0, PaliGemmę obejmują warunki użytkowania Gemma, a jej repozytoria są zabramkowane — pobranie wymaga przyjęcia warunków i oczekiwania na ręczną zgodę. A mimo to ta generacja pozostaje liderem ruchu w całej linii: 619 679 pobrań w trzydziestu dniach do 17 września 2026, około dziesięć razy więcej niż nowsza PaliGemma 2, którą Google opisuje jako zamiennik wstawiany bez zmian w kodzie. Większość tego ruchu bierze dwa repozytoria — zwykła wstępnie nauczona baza w 224 pikselach, naturalny punkt wyjścia do dostrajania, oraz punkt kontrolny podpisów COCO, który siedzi w bardzo wielu zautomatyzowanych potokach opisywania zdjęć.

#vision-language model#image captioning#object detection#OCR#open weights
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję