MDL-8400EST.2025 · IDX.965
Model językowyW produkcji

Qwen3-30B-A3B

Alibaba Cloud · China · 2025

Koń roboczy rodziny Qwen 3: 30,5 mld parametrów, z czego na każdy token pracuje tylko 3,3 mld — odpowiedzi w stylu flagowca mieszczą się na jednej karcie graficznej.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Qwen3-30B-A3B to mały model typu Mixture-of-Experts, wydany razem z generacją Qwen 3 29 kwietnia 2025 roku. Mieści 30,5 mld parametrów w 128 ekspertach rozłożonych na 48 warstwach, ale każdy token przepuszcza tylko przez ośmiu z nich, więc w danej chwili pracuje około 3,3 mld parametrów. Na tej proporcji polega cały pomysł: model odpowiada z rozmachem dużej sieci, a kosztuje w uruchomieniu mniej więcej tyle co mała — i dlatego to właśnie ten rozmiar najczęściej stawia się u siebie. Model ma firmowy przełącznik Qwen 3 między trybem myślenia, przeznaczonym do matematyki, kodu i logiki, a trybem bezpośrednim do zwykłej rozmowy — oba w jednym komplecie wag. Kontekst to 32 768 tokenów natywnie i 131 072 po włączeniu skalowania YaRN, które karta modelu każe włączać wyłącznie wtedy, gdy długie wejście jest naprawdę potrzebne. Obsługiwanych jest ponad 100 języków i dialektów, do tego wywoływanie funkcji i praca w szkieletach agentowych. Alibaba opublikowała wagi na licencji Apache 2.0, z użyciem komercyjnym włącznie, a repozytorium zebrało około 1,9 mln pobrań w ciągu ostatnich trzydziestu dni — tak szerokiego przyjęcia nie ma wiele otwartych modeli jakiegokolwiek rozmiaru. Później w 2025 roku wyszły jeszcze dwa odświeżone wydania pod tą samą nazwą (wariant instrukcyjny w lipcu, z dużo dłuższym oknem, i wariant rozumujący w sierpniu); ten profil opisuje pierwotne wydanie kwietniowe, które pozostaje podstawą niezliczonych cudzych dostrojeń.

#open weights#MoE#multilingual#hybrid thinking
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję