MDL-7882EST.2026 · IDX.366
Model językowyW produkcji

Qwen3-VL-Reranker-2B

Alibaba Cloud · China · 2026

Najczęściej pobierany z czterech modeli wyszukiwawczych Alibaby: przy dwóch miliardach parametrów dokłada prawie osiem punktów w wyszukiwaniu w skanach względem modelu osadzeń o identycznym rozmiarze, za cenę jednego dodatkowego etapu.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Qwen3-VL-Reranker-2B, opublikowany 7 stycznia 2026 roku, to model, który naprawdę pracuje w produkcji. Z 2,07 miliona pobrań z Hugging Face w 30 dniach do 1 września 2026 jest najczęściej używanym z czterech modeli wyszukiwawczych Alibaby — częściej niż oba modele osadzeń i około 48 razy częściej niż ośmiomiliardowy model przestawiający, który bije go w każdym teście. Jego zadaniem jest przestawienie krótkiej listy. Model osadzeń w pierwszym etapie tanio zwraca kandydatów; ten model czyta potem zapytanie razem z każdym kandydatem i ocenia, jak dobrze do siebie pasują. Każda ze stron może być tekstem, zdjęciem, zrzutem ekranu, slajdem albo fragmentem nagrania — i to odróżnia ten zestaw od zwykłego tekstowego modelu przestawiającego: wpisane pytanie da się ocenić względem strony, która istnieje wyłącznie jako obraz. Ciekawa jest odpowiedź na pytanie, co przy tym rozmiarze daje drugi etap. Wobec Qwen3-VL-Embedding-2B — ta sama liczba parametrów, ten sam model bazowy, ta sama rodzina — zyskuje 7,9 punktu w ViDoRe v3 (60,8 wobec 52,9) i 9,9 punktu w JinaVDR (80,9 wobec 71,0), a oba te testy dotyczą wyszukiwania w dokumentach zeskanowanych i renderowanych. W zwykłym wyszukiwaniu obrazów i wideo jest minimalnie z tyłu, odpowiednio o 1,0 i 1,5 punktu. Przestawianie wyników opłaca się więc dokładnie tam, gdzie dokument jest zdjęciem tekstu — faktury, slajdy, raporty, formularze — a prawie wcale tam, gdzie jest fotografią. Porównanie z bezpośrednim konkurentem wypada mniej jednoznacznie, niż sugeruje ujęcie producenta, i warto to powiedzieć: wobec jina-reranker-m0, również dwumiliardowego, jest lepszy w wyszukiwaniu obrazów (73,8 wobec 68,2) i w ViDoRe v3 (60,8 wobec 57,8), ale słabszy w wyszukiwaniu w dokumentach obrazowych (83,4 wobec 85,2) i w JinaVDR (80,9 wobec 82,2). Konstrukcyjnie to Qwen3-VL-2B-Instruct z głowicą oceniającą: 28 warstw, wymiar ukryty 2048, moduł wizyjny z 24 bloków, 2,13 miliarda parametrów, wspierane okno 32 768 tokenów, ponad 30 języków. Mieści się swobodnie na jednej konsumenckiej karcie graficznej i to jest cała przyczyna jego popularności. Wagi na licencji Apache 2.0, bez wyłączenia dla Europy.

#open weights#reranking#retrieval#multimodal#vision#small model#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję