SigLIP 2
Google DeepMind · USA · 2025
Rodzina koderów obraz-tekst, które klasyfikują zdjęcia według etykiet, jakich nigdy nie widziały na treningu — i element, który po cichu siedzi w środku wielu cudzych modeli wielomodalnych.
SigLIP 2 to rodzina koderów obraz-tekst opublikowana przez Google DeepMind 20 lutego 2025. Nie odpowiada na pytania i nie generuje tekstu. Umieszcza obraz i fragment tekstu we wspólnej przestrzeni wektorowej, a to wystarcza do dwóch zadań spotykanych wszędzie: klasyfikacji obrazu w trybie zero-shot, gdzie etykiety wypisuje się po prostu jako tekst w chwili użycia, oraz wyszukiwania obrazów tekstem i tekstu obrazem. Najważniejsze jest jednak zadanie trzecie, najmniej widoczne — to standardowa wieża wizyjna doklejana do wielomodalnych modeli językowych, w tym do własnej MedGemmy Google. Druga generacja zachowuje funkcję straty sigmoidalnej, od której wzięła się nazwa linii, i dokłada do niej trzy pomysły treningowe: stratę dekodera, stratę predykcji globalno-lokalnej i maskowanej oraz przystosowanie do proporcji i rozdzielczości obrazu. Sens tych dodatków jest dokładnie taki, jak obiecuje tytuł publikacji — lepsze rozumienie znaczenia, lepsza lokalizacja i lepsze cechy gęste, czyli koder jest przydatniejszy tam, gdzie coś trzeba na obrazie znaleźć, a nie tylko rozpoznać. Trening wstępny idzie na wielojęzycznym zbiorze obraz-tekst WebLI, na maksymalnie 2048 układach TPU v5e. Wydanie ma postać siatki, a nie pojedynczego modelu: cztery rozmiary — base o 375 milionach parametrów, large o 882 milionach, so400m o 1,14 miliarda i giant-opt o 1,87 miliarda — każdy w rozdzielczościach od 224 do 512 pikseli, plus osobna linia NaFlex, która zachowuje naturalne proporcje obrazu zamiast wtłaczać go w kwadrat. Obok punktów kontrolnych dla PyTorcha są wersje dla JAX-a. Ruch skupia się na dole tej siatki: sam model base w 256 pikselach pobiera się 3,89 miliona razy miesięcznie, więcej niż jakikolwiek inny model Google w tym katalogu, bo to najtańszy koder, który jest już wystarczająco dobry, żeby na nim budować. Całość jest na Apache 2.0, bez bramki i bez warunków do akceptacji — i to jest praktyczny powód, dla którego tyle cudzych modeli stoi właśnie na nim. Porównanie wyników z SigLIP 1 Google publikuje wyłącznie w publikacji naukowej i jako obrazek na karcie modelu, więc katalog tych liczb nie przytacza.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!