Qwen3-VL-Embedding-2B
Alibaba Cloud · China · 2026
Wejście do zestawu wyszukiwawczego Alibaby: indeksuje zdjęcia, skany i wideo razem z tekstem na jednej konsumenckiej karcie graficznej, a długość wektora da się zmieniać od 2048 aż do 64.
Qwen3-VL-Embedding-2B, opublikowany 7 stycznia 2026 roku, to mały koniec zestawu wyszukiwawczego Alibaby i model, który najczęściej stanowi pierwszy etap działającej wyszukiwarki. Zamienia dokument w wektor, dzięki czemu wyszukiwanie odbywa się przez odległość, a nie przez słowo kluczowe. Dokumentem może być akapit, zdjęcie, zrzut ekranu, zeskanowana strona albo fragment nagrania — wszystko trafia do jednej wspólnej przestrzeni, więc zapytanie tekstem znajduje obraz, a obraz znajduje akapit. To Qwen3-VL-2B-Instruct przystosowany do reprezentacji: 28 warstw, wymiar ukryty 2048, moduł wizyjny z 24 bloków wpinający się do modelu językowego z warstw 5, 11 i 17, 2,13 miliarda parametrów, wspierane okno 32 768 tokenów i ponad 30 języków. Wektor wyjściowy ma do 2048 liczb, a jego długość da się skrócić aż do 64 dzięki uczeniu matrioszkowemu; obsługiwane są też osadzenia kwantyzowane. Przy dużym indeksie znaczy to więcej, niż brzmi: krótszy wektor to mniejszy indeks i szybsze porównanie, a ten kompromis można dobrać już po wdrożeniu modelu. W teście wielomodalnym producenta MMEB-V2 uzyskuje 73,4 punktu wobec 77,9 wersji ośmiomiliardowej. W tekstowym MMTEB uzyskuje 63,87 — poniżej własnego, tekstowego Qwen3-Embedding-4B tej samej firmy z wynikiem 69,45, czyli modelu mniej więcej dwukrotnie większego, ale całkowicie pozbawionego wzroku. Wniosek praktyczny jest w całej tej rodzinie ten sam: indeksowanie wielomodalne opłaca się, gdy archiwum naprawdę zawiera obrazy, a jest czystą stratą, gdy ich nie zawiera. Jeszcze jedno porównanie warto przenieść na decyzję projektową. W wyszukiwaniu w dokumentach zeskanowanych i renderowanych ten model wyraźnie ustępuje modelowi przestawiającemu o identycznym rozmiarze: 52,9 wobec 60,8 w ViDoRe v3 i 71,0 wobec 80,9 w JinaVDR. Te liczby nie są argumentem przeciwko modelowi osadzeń, bo wykonuje on inne zadanie, ale są argumentem za dołożeniem drugiego etapu, a nie za kupowaniem większego pierwszego. Popularność w 30 dniach do 1 września 2026: 1,38 miliona pobrań z Hugging Face i 446 polubień, czyli więcej niż model osadzeń w wersji ośmiomiliardowej. Wagi na licencji Apache 2.0, bez wyłączenia dla Europy.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!