Wszystkie newsyBadania

Najczęściej pobierany model Alibaby należy do linii, której producent już nie rozwija

Opublikowano: 2.09.2026 · Źródło: Alibaba, karty i pliki konfiguracyjne modeli Qwen3-VL, Qwen3.5 i Qwen3.8 (Hugging Face)

Najczęściej pobierany model, jaki Alibaba kiedykolwiek wydała, nie jest czatem i nie należy do bieżącego pokolenia tej firmy. To Qwen3-VL-8B-Instruct, model widzenia z października 2025 roku, pobrany z Hugging Face 9,58 miliona razy w trzydziestu dniach do 2 września 2026 roku — częściej niż jakikolwiek model czatowy Qwen dowolnego pokolenia i częściej niż cała rodzina Granite firmy IBM razem wzięta. Nie byłoby w tym nic dziwnego, gdyby linia nadal powstawała. Nie powstaje. W lutym 2026 roku Alibaba wydała Qwen3.5 — linię flagową, w której widzenie nie jest już osobnym produktem: modele główne same przyjmują obraz i wideo. Od tamtej pory nowego flagowca linii VL nie było. Ostatni, Qwen3-VL-235B-A22B, pochodzi z września 2025 roku. Najciekawsze jest to, co nie przeprowadziło się razem z widzeniem. Linię VL zbudowano wokół mechanizmu, który Alibaba nazywa DeepStack: wpina on do modelu językowego cechy obrazu z trzech pośrednich warstw modułu wizyjnego, a producent przedstawia go jako źródło drobnoziarnistego wiązania obrazu z tekstem. Gdy otworzyć pliki konfiguracyjne modeli, które zastąpiły tę linię, lista łączenia jest pusta: Qwen3.5-9B, Qwen3.6-27B i Qwen3.8-27B mają moduł wizyjny tej samej głębokości i żaden z nich nie wpina cech znikąd. Modele główne widzą, ale nie tak, jak widziała linia widzenia. Alibaba nie opublikowała porównania obu rozwiązań ani wyjaśnienia zmiany, a to nie jest twierdzenie, że nowsze modele gorzej patrzą na zdjęcia — nie mierzyliśmy tego, a wykresy producenta tej kwestii nie dotykają. Powiedzieć można mniej, ale i to warto powiedzieć: konstrukcję reklamowaną jako przewaga w pracy z obrazem porzucono bez słowa komentarza, a użytkownicy głosujący pobraniami w większości zostali przy starszej. Jest jeszcze drugi szczegół dla tych, którzy wybierają rozmiar. Dwumiliardowa wersja linii widzenia, opublikowana 19 października 2025 roku, ma nie tylko mniejszy model językowy. Jej moduł wizyjny ma 24 bloki wobec 27 w wersjach ośmio- i 235-miliardowej i wpina cechy z warstw 5, 11 i 17 zamiast 8, 16 i 24. Mały model patrzy mniejszym okiem, o czym żadna karta katalogowa nie wspomina. wujec.ai dodał dziś profile całej trójki: ośmiomiliardowego konia roboczego, 235-miliardowego flagowca i wersji dwumiliardowej na telefon i laptop. Wszystkie na licencji Apache 2.0, bez wyłączenia dla Europy. Wyniki testów Alibaba publikuje wyłącznie jako obrazki wykresów, nie tabele, więc nasze profile nie cytują żadnych liczb.