Qwen3-VL-Embedding-8B
Alibaba Cloud · China · 2026
Największy model Alibaby do indeksowania wyszukiwarek: zamienia tekst, zrzuty ekranu, zdjęcia i wideo we wspólny układ współrzędnych — ale w samym tekście wypada słabiej niż tekstowy model tej samej firmy o identycznym rozmiarze.
Qwen3-VL-Embedding-8B, opublikowany 7 stycznia 2026 roku, nie prowadzi rozmowy. Zamienia dokument w listę liczb — wektor — dzięki czemu wyszukiwarka znajduje materiały pokrewne, mierząc odległość między wektorami. Nietypowe w tej wersji jest to, że dokumentem nie musi być tekst: zdjęcie, zrzut ekranu, zeskanowana faktura, slajd czy fragment nagrania trafiają do tego samego układu współrzędnych co zdanie. Zapytanie tekstowe może więc wyszukać obraz, a zapytanie obrazem — akapit. Model powstał na bazie Qwen3-VL-8B-Instruct i dziedziczy jego budowę: 36 warstw, wymiar ukryty 4096, moduł wizyjny z 27 bloków wpinający cechy do modelu językowego z warstw 8, 16 i 24. Ma 8,14 miliarda parametrów, czyli około 622 miliony mniej niż jego bliźniak przestawiający wyniki. Powód jest prosty: model, który produkuje wyłącznie wektory, nie potrzebuje warstwy wyjściowej zamieniającej stan ukryty z powrotem w tokeny słownika, więc Alibaba po prostu nie umieściła jej w pliku wag. Producent podaje okno pracy 32 768 tokenów; pliki konfiguracyjne dopuszczają znacznie więcej, ale wspierana jest wartość 32 tys. Wektor wyjściowy ma do 4096 liczb, a jego długość da się skrócić aż do 64. Projekt oszczędzający pamięć może więc wymienić precyzję na rozmiar indeksu bez ponownego uczenia czegokolwiek. W teście wyszukiwania wielomodalnego producenta (MMEB-V2, 78 zbiorów danych) model uzyskuje 77,9 punktu — najwyższy wynik w tabeli porównawczej opublikowanej przez Alibabę, wyżej niż zamknięty Seed-1.6-embedding z 76,9 i wyżej niż wszyscy wymienieni konkurenci o otwartych wagach. Jeden wynik z tej samej karty zasługuje na uwagę czytelnika, bo przemawia przeciwko używaniu tego modelu. W teście tekstowym MMTEB uzyskuje on 67,88 punktu, podczas gdy własny, wyłącznie tekstowy Qwen3-Embedding-8B tej samej firmy i o tej samej liczbie parametrów — 70,58. Oczy nie są za darmo. Jeśli indeks wyszukiwarki zawiera wyłącznie tekst, lepszym narzędziem jest starszy model tekstowy, i mówią to wprost liczby samego producenta. Model obsługuje ponad 30 języków i przyjmuje instrukcje dopasowane do zadania; według producenta dają one od 1 do 5 procent dokładności więcej i należy je pisać po angielsku nawet dla materiałów w innych językach. Wagi na licencji Apache 2.0, bez wyłączenia dla Europy. Popularność w 30 dniach do 1 września 2026: 1,22 miliona pobrań z Hugging Face i 475 polubień.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!