Tabela samej Alibaby pokazuje, ile oczy kosztują model wyszukiwarki: prawie trzy punkty dokładności w tekście
Opublikowano: 2.09.2026 · Źródło: Alibaba, karty modeli Qwen3-VL-Embedding i Qwen3-VL-Reranker oraz raport techniczny arXiv 2601.04720 (Hugging Face) ↗
Model indeksujący wyszukiwarkę nie rozmawia. Zamienia dokument w wektor, a wyszukiwarka znajduje materiały pokrewne, mierząc odległość. Linia Qwen3-VL-Embedding Alibaby, opublikowana 7 stycznia 2026 roku i dodana dziś do naszego katalogu, robi to również dla obrazów: zdjęcie, zrzut ekranu, zeskanowana faktura czy fragment nagrania trafiają do tego samego układu współrzędnych co zdanie.
Ciekawa liczba nie stoi w materiałach reklamowych. Stoi w drugiej tabeli na tej samej karcie modelu. W teście tekstowym MMTEB Qwen3-VL-Embedding-8B uzyskuje 67,88 punktu. Własny, wyłącznie tekstowy Qwen3-Embedding-8B tej samej firmy, o tej samej liczbie parametrów i opublikowany wcześniej — 70,58. W mniejszej parze różnica jest jeszcze wyraźniejsza: dwumiliardowy model wielomodalny ma 63,87, a tekstowy model czteromiliardowy 69,45.
Czytane wprost, jest to cennik. Danie modelowi wyszukiwawczemu oczu nie jest darmowym dodatkiem; w tekście czyni ten model mierzalnie gorszym od tekstowego modelu tego samego producenta o dopasowanym rozmiarze. Jeśli indeks zawiera wyłącznie tekst, lepszym narzędziem jest starszy model — a dowód wydrukowała sama Alibaba, zamiast zostawić go recenzentom.
Drugie ustalenie z tego zestawu dotyczy tego, który model ludzie naprawdę uruchamiają. Alibaba wydała cztery: osadzenia i przestawianie wyników, w wersjach dwu- i ośmiomiliardowej. Ośmiomiliardowy model przestawiający wygrywa każdą kolumnę porównania producenta — 79,2 punktu w wyszukiwaniu wielomodalnym, 86,3 w dokumentach obrazowych, 66,7 w ViDoRe v3. W trzydziestu dniach do 1 września 2026 pobrano go 43 201 razy. Dwumiliardowy model przestawiający, który przegrywa z nim wszędzie, pobrano 2,07 miliona razy — około czterdziestu ośmiu razy częściej.
Ta przepaść wynika z konstrukcji, nie z mody. Model przestawiający uruchamia się raz na kandydata, więc lista stu dokumentów to sto przebiegów, zanim użytkownik zobaczy wynik. Przy ośmiu miliardach parametrów to koszt, którego niewiele wyszukiwarek udźwignie, i lider dokładności ląduje w archiwach, gdzie czekanie jest do przyjęcia: w postępowaniach prawnych, dokumentacji medycznej i technicznej.
Jeszcze jedna liczba warta jest przeniesienia na decyzję projektową, bo kieruje pieniądze w nieoczekiwaną stronę. W porównaniu dwóch modeli o identycznym rozmiarze dwumiliardowy model przestawiający bije dwumiliardowy model osadzeń o 7,9 punktu w ViDoRe v3 i o 9,9 w JinaVDR, a oba te testy mierzą wyszukiwanie w stronach zeskanowanych i renderowanych. W zwykłych zdjęciach i wideo jest minimalnie z tyłu. Drugi etap zarabia na siebie dokładnie tam, gdzie dokument jest zdjęciem tekstu — przy fakturach, slajdach i formularzach — co sugeruje, że zespół z ograniczonym budżetem powinien raczej dołożyć etap, niż kupować większy model.
Wszystkie cztery modele mają wagi na licencji Apache 2.0 bez wyłączenia dla Europy, obsługują ponad 30 języków i okno 32 768 tokenów. Profile każdego z nich są już w katalogu.