MDL-6265EST.2026 · IDX.594
Model językowyW produkcji

Ling-3.0-flash-VL

InclusionAI (Ant Group) · China · 2026

Wizyjno-wideo odmiana taniego flagowca grupy Ant: 124 mld parametrów, 5,5 mld aktywnych i okno 256 tys. tokenów, które wydany model osiąga dopiero przez rozciągnięcie okna 131 tys.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Ling-3.0-flash-VL to multimodalna odnoga bieżącej generacji InclusionAI, otwartoźródłowego ramienia grupy Ant, czyli spółki stojącej za Alipay. Wagi pojawiły się na Hugging Face 4 września 2026 r., warianty skwantowane fp8, fp4 i int4 dzień 8 września, a serwowanie przez firmy trzecie na OpenRouterze ruszyło 10 września. Tak samo jak przy tekstowym Ling-3.0-flash licencja MIT istnieje wyłącznie jako linijka metadanych w karcie modelu; w repozytorium nie ma osobnego pliku licencji. Szkielet jest ten sam, który czytelnik zna z Ling-3.0-flash: rzadka mieszanka ekspertów, 512 ekspertów kierowanych z 8 aktywnymi i jednym współdzielonym, 42 warstwy przeplatające uwagę Kimi Delta z bramkowaną MLA w stosunku 5:1, wymiar ukryty 2560, 32 głowice uwagi, słownik 157 184. Producent podaje 124 miliardy parametrów łącznie i 5,5 miliarda aktywowanych na token; opublikowany indeks wag liczy 124,8 miliarda, a liczba aktywowanych jest nieco wyższa niż 5,1 miliarda podawane dla tekstowego rodzeństwa — to właśnie koszt doklejonej części wizyjnej. Za obraz odpowiada 27-warstwowy ViT o wymiarze ukrytym 1152 i łatkach 16-pikselowych, scalanych po dwie w pionie i poziomie oraz po dwie w czasie, a potem dopasowywanych do modelu językowego przez dwuwarstwowy projektor MLP. Kolejność w czasie koduje VideoRoPE i to dzięki niemu model odpowiada na pytania o długie nagrania i wskazuje w nich momenty zdarzeń, zamiast opisywać pojedyncze klatki. Jeden szczegół wart odnotowania: w opublikowanej konfiguracji wieża wizyjna jest zadeklarowana typem qwen3_moe_vit, czyli architekturą wizyjną Qwen3 od Alibaby — bezpośredniego konkurenta grupy Ant na chińskim rynku modeli. Okno kontekstu wymaga ostrożności. Karta modelu reklamuje do 256 tys. tokenów i firmowy przepis uruchomieniowy faktycznie serwuje 262 144 — ale dochodzi do tego, włączając skalowanie YaRN współczynnikiem 2,0 na oknie wyjściowym 131 072, a dokładnie 131 072 deklaruje wydana konfiguracja modelu. Tekstowy Ling-3.0-flash dla porównania deklaruje 262 144 natywnie. Różnica widać w praktyce: na OpenRouterze płatna pozycja tego modelu podaje kontekst 131 072 tokenów, a pozycja darmowa 262 144. InclusionAI podaje, że wersja wizyjna osiąga 42 punkty w indeksie Artificial Analysis Intelligence Index w wersji 4.1.1 wobec 38 punktów modelu tekstowego, i przedstawia ten przyrost jako dowód, że dodanie wzroku poprawia ogólne rozumowanie; to porównanie pochodzi od samego producenta. Tryb myślenia jest włączony domyślnie i można go wyłączyć w pojedynczym zapytaniu. Serwowanie kosztuje mniej więcej trzy razy tyle co model tekstowy — około 0,06 dolara za milion tokenów wejściowych i 0,18 dolara za milion wyjściowych wobec 0,021 i 0,063 — więc wersja wizyjna jest tania jak na rynek, ale nie jest już cenową osobliwością, jaką było jej tekstowe rodzeństwo.

#open weights#MIT license#MoE#multimodal#vision#video#agentic#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję