MDL-8587EST.2026 · IDX.621
Model językowyW produkcji

Qwen3.5-35B-A3B

Alibaba Cloud · China · 2026

Rzadki model wizyjno-językowy o otwartych wagach, który mieści 36 miliardów parametrów, a liczy naraz tylko trzema z nich — i mimo to w tabelach rozumowania Alibaby wypada wyżej niż stodwudziestomiliardowy otwarty model OpenAI.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Qwen3.5-35B-A3B, opublikowany 24 lutego 2026 r., to model, na którym najłatwiej zrozumieć rzadkie podejście Alibaby. Pliki wag zawierają 35,95 miliarda parametrów, ale każdy token trafia do ośmiu z 256 ekspertów plus jednego eksperta wspólnego, więc w danej chwili pracuje około trzech miliardów parametrów. Koszt liczenia wyznacza ta liczba aktywna, a wymagana pamięć — liczba całkowita. Ta wymiana wypada korzystnie. W tabelach producenta model osiąga MMLU-Pro 85,3, GPQA Diamond 84,2, HMMT z lutego 2025 na poziomie 89,0 i SWE-bench Verified 69,2 — w pierwszych trzech wyżej niż GPT-OSS-120B, otwarty model OpenAI o trzy i pół raza większej liczbie parametrów, i blisko hostowanego GPT-5-mini we wszystkich. Na TAU2-Bench, który sprawdza, czy agent doprowadza do końca wieloetapową sprawę klienta, notuje 81,2 — najwyższy wynik w całym zestawieniu producenta, przed większym rodzeństwem Qwen3.5-122B-A10B (79,5) i gęstym modelem 27B (79,0). Jak wszystko w tej generacji, model ten widzi. Widzenie jest wtrenowane od początku, a nie doklejone osobną linią, i model osiąga MMMU 81,4 oraz MathVision 83,9 — to drugie wyraźnie powyżej wyspecjalizowanego Qwen3-VL-235B-A22B z poprzedniej generacji (74,6), czyli modelu wizyjnego ponad sześć razy od siebie większego. Układ to 40 warstw jako dziesięć powtórzeń trzech bloków Gated DeltaNet i jednego bloku uwagi bramkowanej, każdy zakończony mieszaniną ekspertów; wymiar ukryty 2048, szerokość eksperta 512, słownik 248 320 tokenów, trening z przewidywaniem wielu tokenów naraz. Inaczej niż w mniejszych, gęstych modelach tej generacji, wagi wyjściowe nie są związane z wejściowymi. Kontekst to 262 144 tokeny natywnie, według producenta rozciągalne do 1 010 000. Wagi są na licencji Apache 2.0, z niezmienionym tekstem licencji w repozytorium, a model pobierany jest z Hugging Face około 2,4 miliona razy w oknie trzydziestu dni — do czego dochodzi 13,5 miliona pobrań wersji FP8 jego następcy z generacji 3.6, dziś najczęściej pobieranego pliku zespołu Qwen.

#open weights#mixture of experts#multimodal#local deployment#China#agentic
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję