MDL-6625EST.2025 · IDX.747
Model językowyW produkcji

Qwen3-VL-235B-A22B-Instruct

Alibaba Cloud · China · 2025

Flagowiec osobnej linii widzenia Alibaby: 235 miliardów parametrów, z których nad każdym tokenem pracuje 22 miliardy, wydany na otwartych wagach pięć miesięcy przed wchłonięciem widzenia do modeli głównych.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Qwen3-VL-235B-A22B-Instruct, opublikowany 22 września 2025 roku, otworzył trzecie pokolenie modeli widzenia Alibaby i pozostaje największym modelem, jaki ta firma wydała z myślą o patrzeniu, a nie o rozmowie. To model z mieszanką ekspertów: 235,67 miliarda parametrów w 94 warstwach i 128 ekspertach, z których nad każdym tokenem pracuje ośmiu, czyli około 22 miliardów parametrów naraz. Okno kontekstu to 262 144 tokeny natywnie, według producenta rozciągalne do miliona. To, co wniosło całe pokolenie, łatwiej opisać niż zmierzyć. Przeplatane MRoPE rozkłada informację o położeniu na czas, szerokość i wysokość, zamiast wyróżniać jedną oś, z myślą o rozumowaniu nad długim wideo. DeepStack wpina do modelu językowego cechy z trzech pośrednich warstw modułu wizyjnego — ósmej, szesnastej i dwudziestej czwartej — i to jemu producent przypisuje drobnoziarniste wiązanie obrazu z tekstem. Wiązanie opisu ze znacznikiem czasu zastąpiło wcześniejszy sposób lokalizowania zdarzeń w nagraniu, a rozpoznawanie tekstu na obrazie rozszerzono z 19 języków do 32. Ważniejsze od pojedynczej liczby jest odczytanie strategii. Alibaba wydała ten model we wrześniu 2025 roku, w październiku dołożyła gęste warianty aż do dwóch miliardów parametrów, a w lutym 2026 roku wypuściła Qwen3.5 — linię flagową, w której widzenie nie jest już osobnym produktem, tylko częścią modelu głównego. Od tamtej pory nowego flagowca linii VL nie było. Gdy zajrzeć do plików konfiguracyjnych modeli, które ją zastąpiły, lista łączenia DeepStack jest pusta: modele główne widzą, ale nie korzystają z wielopoziomowego łączenia cech, wokół którego zbudowano tę linię. Dla czytelnika wybierającego dzisiaj daje to obraz niewygodny, ale uczciwy. To model ostatni w swojej linii, bez następców, a zarazem jedyny model tego producenta o otwartych wagach zbudowany od podstaw do pracy z obrazem w skali czołowej. W trzydziestu dniach do 2 września 2026 roku pobrano go 825 tysięcy razy — dziesięciokrotnie rzadziej niż jego ośmiomiliardowego brata, czego należy oczekiwać po modelu wymagającym szafy serwerowej zamiast karty graficznej. Wyniki testów producent publikuje wyłącznie jako obrazki wykresów, nie tabele, więc profil nie cytuje żadnych liczb. Wagi na licencji Apache 2.0, bez wyłączenia dla Europy.

#open weights#mixture of experts#multimodal#vision#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję