MDL-6017EST.2026 · IDX.184
category.visionW produkcji

TIPSv2

Google DeepMind · USA · 2026

Rodzina koderów obraz-tekst, które opisują nie tylko całe zdjęcie, ale każdy jego fragment z osobna — i dlatego potrafią wyciąć z obrazu i zmierzyć głębię obiektu nazwanego wyłącznie słowem.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

TIPSv2 — Text-Image Pre-training with Spatial awareness — to rodzina koderów obraz-tekst z Google DeepMind, opublikowana na Hugging Face 9 kwietnia 2026 razem z pracą na konferencję CVPR 2026. Należy do tej samej klasy co SigLIP: obraz i fragment tekstu trafiają do wspólnej przestrzeni wektorowej, więc etykiety można podać słowami w chwili użycia. Różnica jest w tym, co model zwraca. Poza jednym globalnym wektorem dla całego zdjęcia oddaje osobny wektor cech dla każdego fragmentu o boku 14 pikseli, osadzony w tej samej przestrzeni co tekst. Obraz o boku 448 pikseli daje więc 1024 opisy fragmentów zamiast jednego opisu całości. To właśnie zamienia koder w narzędzie do zadań, w których trzeba wiedzieć, gdzie coś jest, a nie tylko czy w ogóle jest. Segmentacja zero-shot wychodzi wprost: porównuje się osadzenie słowa z każdym fragmentem, a pasujące obrysowują obiekt. Google wydaje też dla każdego rozmiaru osobne warianty DPT, które doklejają do tego samego kręgosłupa głowicę gęstej predykcji do szacowania głębi. Same cechy fragmentów są użyteczne nawet bez żadnej głowicy — analiza głównych składowych i pomalowanie trzech pierwszych składowych jako kanałów koloru daje czytelną mapę struktury obrazu, czyli standardowy sposób pokazania, że model zrozumiał scenę, a nie tylko przykleił do niej etykietę. Rodzina ma cztery rozmiary, liczone osobno dla obu wież: B/14 to 86 milionów parametrów wizyjnych i 110 milionów tekstowych, L/14 — 303 i 184 miliony, SO400m/14 — 412 i 448 milionów, a g/14 — 1,1 miliarda i 389 milionów, przy wymiarach osadzenia od 768 do 1536. Obie wieże to transformery o 27 warstwach. Obrazy przyjmuje w dowolnej rozdzielczości i nie wymaga normalizacji ImageNet; tekst przechodzi przez tokenizator SentencePiece, jest zamieniany na małe litery i ucinany na 64 tokenach. Całość jest na Apache 2.0, bez bramki. Ruch rozkłada się niemal po równo między SO400m i mały wariant B/14 — 276 i 256 tysięcy pobrań miesięcznie — co sugeruje, że model służy zarówno jako kręgosłup badawczy, jak i jako tani element cudzych rozwiązań. Google nie publikuje tabeli wyników na karcie modelu; porównania są w publikacji naukowej.

#vision encoder#zero-shot segmentation#depth estimation#spatial features#open weights
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję