MDL-2601EST.2025 · IDX.854
Model językowyW produkcji

Qwen3-VL-8B-Instruct

Alibaba Cloud · China · 2025

Najczęściej pobierany model, jaki Alibaba kiedykolwiek wydała: model widzenia o 8,8 miliarda parametrów, który czyta dokumenty w 32 językach, obsługuje interfejsy telefonu i komputera i mieści się na jednej karcie graficznej.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Qwen3-VL-8B-Instruct, opublikowany 11 października 2025 roku, jest koniem roboczym linii modeli widzenia Alibaby i — licząc pobrania — najpopularniejszym modelem, jaki ta firma kiedykolwiek wydała. W trzydziestu dniach do 2 września 2026 roku pobrano go z Hugging Face 9,58 miliona razy: częściej niż jakikolwiek model czatowy Qwen dowolnego pokolenia i częściej niż całą rodzinę Granite firmy IBM razem wziętą. Powody są praktyczne, a nie efektowne. Model ma 8,77 miliarda parametrów, wszystkie aktywne, w 36 warstwach o wymiarze ukrytym 4096, co mieści go na jednej konsumenckiej karcie graficznej z 24 GB pamięci, a po kwantyzacji spokojnie na laptopie. Okno kontekstu wynosi 262 144 tokeny natywnie, a według producenta daje się rozciągnąć do miliona. I robi nudne rzeczy, za które firmy naprawdę płacą: rozpoznaje tekst na zdjęciach i skanach w 32 językach, wobec 19 w poprzednim pokoleniu, według producenta odporne na słabe światło, poruszenie i przekrzywienie kadru, i lepiej radzące sobie ze znakami rzadkimi i archaicznymi. Ambitniejsze deklaracje dotyczą samodzielności. Alibaba przedstawia ten model jako agenta wizualnego: rozpoznaje elementy interfejsu na ekranie komputera i telefonu, rozumie ich działanie i steruje nimi, żeby wykonać zadanie. Generuje też diagramy Draw.io oraz kod HTML, CSS i JavaScript ze zrzutu ekranu albo klatki filmu. Osobno podkreślana jest praca z przestrzenią — wskazywanie obiektów na płaszczyźnie ma być mocniejsze, a wskazywanie w trzech wymiarach jest oferowane z myślą o robotyce. W wideo dawne kodowanie pozycji zastąpiono wiązaniem opisu ze znacznikiem czasu, co pozwala odnaleźć zdarzenie z dokładnością do sekundy w wielogodzinnym nagraniu. Jeden szczegół konstrukcji wart jest odnotowania, bo producent go nie eksponuje. Pliki konfiguracyjne tego modelu wpinają do modelu językowego cechy obrazu z trzech pośrednich warstw modułu wizyjnego — mechanizm, który Alibaba nazywa DeepStack. We wszystkich flagowcach wydanych od lutego 2026 roku, począwszy od Qwen3.5, widzenie jest wbudowane w model główny, ale ta lista jest pusta. Osobna linia widzenia została wchłonięta przez flagowca, a reklamowane w niej drobnoziarniste łączenie cech nie pojechało razem z nią. Czy to cokolwiek kosztuje w praktyce, Alibaba nie opublikowała; liczby pobrań pokazują, że bardzo wielu użytkowników nie przesiadło się dalej. Wyniki testów producent publikuje wyłącznie jako obrazki wykresów, a nie tabele, więc ten profil ich nie cytuje. Wagi są na licencji Apache 2.0, bez wyłączenia dla Europy i bez dodatkowych ograniczeń.

#open weights#dense#multimodal#vision#local deployment#China
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję