Qwen3.5-2B
Alibaba Cloud · China · 2026
Model wizyjno-językowy o dwóch miliardach parametrów na licencji Apache 2.0, mieszczący się na laptopie, który czyta dokumenty lepiej niż dwukrotnie większy model wizyjny tej samej firmy — a mimo to producent poleca go do prototypów i dostrajania, a nie do pracy produkcyjnej.
Qwen3.5-2B, opublikowany 28 lutego 2026 r., to miejsce, w którym sam producent zmienia ton opisu swojej generacji. Od tego rozmiaru w dół karta modelu zawiera zdanie, którego nie ma przy żadnym większym rodzeństwie: przy takiej liczbie parametrów przeznaczeniem są prototypy, dostrajanie do konkretnego zadania oraz badania i rozwój. Po cichu znika też obietnica okna kontekstu rozciągalnego do miliona tokenów; deklarowane jest wyłącznie 262 144 tokeny natywnie. Tę ostrożność warto czytać razem z tym, co model faktycznie potrafi. To pełny system wizyjno-językowy, a według liczb Alibaby bije Qwen3-VL-2B — wyspecjalizowany model wizyjny poprzedniej generacji o tym samym rozmiarze — praktycznie we wszystkich testach obrazowych: MMMU 64,2 wobec 61,4, OCRBench 84,5 wobec 79,2, CharXiv 58,8 wobec 37,1 i VlmsAreBlind 75,8 wobec 50,0. W kilku zadaniach dokumentowych i wykresowych wyprzedza także dwa razy większy Qwen3-VL-4B: OCRBench 84,5 wobec 80,8, CharXiv 58,8 wobec 50,3, CountBench 91,4 wobec 89,4. Ostrzeżenie producenta zarabia na siebie w tekście. Z włączonym rozumowaniem podane są MMLU-Pro 66,5, GPQA 51,6 i IFEval 78,6 — przyzwoicie jak na ten rozmiar, ale za każdym razem wyraźnie poniżej starszego Qwen3-4B-2507. Podłoga widać najlepiej w matematyce olimpijskiej: HMMT z lutego 2025 na poziomie 22,9 wobec 57,5. To model, który rzetelnie czyta i opisuje, a rozumuje tylko na krótkim dystansie. Pliki wag zawierają 2,27 miliarda parametrów w formacie bfloat16, razem z koderem obrazu — około 4,5 GB na dysku, więc uruchomi go bez kwantyzacji średnia karta graficzna w laptopie albo komputer Apple ze wspólną pamięcią. Budowa jest zgodna z generacją: 24 warstwy jako sześć powtórzeń trzech bloków Gated DeltaNet i jednego bloku uwagi bramkowanej, wymiar ukryty 2048, osiem głowic zapytań na dwie głowice klucza i wartości, słownik 248 320 tokenów, wagi wyjściowe związane z wejściowymi. Licencja to Apache 2.0, a plik licencji w repozytorium jest niezmienionym tekstem Apache.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!