MDL-3157EST.2025 · IDX.006
Model językowyW produkcji

Kimi-VL A3B Thinking 2506

Moonshot AI · China · 2025

Otwarty model wizyjny o 16 miliardach parametrów, który myśli przed odpowiedzią, zużywa około trzech miliardów parametrów na token i czyta ekran na tyle dobrze, by go obsługiwać.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Kimi-VL A3B Thinking 2506, opublikowany 21 czerwca 2025 r., to mały model rozumujący Moonshot AI, przeznaczony do obrazu i wideo. Jego sensem są proporcje: 16,4 miliarda parametrów łącznie, ale mieszanka 64 ekspertów uruchamia tylko sześciu na token plus dwóch współdzielonych, więc generowanie kosztuje mniej więcej trzy miliardy parametrów — na tyle mało, by zmieścić się na jednym akceleratorze, a model i tak wypisuje jawny tok rozumowania przed odpowiedzią. Obrazy wchodzą przez firmowy koder MoonViT w natywnej rozdzielczości, do 3,2 miliona pikseli w jednym zdjęciu, czyli czterokrotnie więcej niż w poprzedniej wersji — i to dlatego model radzi sobie z gęstymi zrzutami ekranu, a nie tylko z fotografią. Okno kontekstu ma 131 072 tokeny. Wydanie 2506 jest poprawką wcześniejszego kompromisu, a nie nowym modelem. Pierwsza wersja Thinking dobrze rozumowała, ale widocznie gorzej od nierozumującego Instruct tej samej wielkości radziła sobie ze zwykłym patrzeniem. Ta wersja tę różnicę zasypuje: podaje MathVision 56,9 (wzrost o 20,1 punktu), MathVista 80,1, MMMU 64,0 i MMMU-Pro 46,3, a przy zwykłym rozpoznawaniu dorównuje wersji Instruct albo ją wyprzedza — MMBench-EN-v1.1 84,4, MMStar 70,4, RealWorldQA 70,0 — i robi to przy około dwadzieścia procent krótszym toku rozumowania. Moonshot deklaruje też pierwsze miejsce wśród modeli otwartych w teście VideoMMMU (65,2) przy Video-MME 71,9. Dla pracy agentowej najciekawsze są wyniki obsługi ekranu: 52,8 w ScreenSpot-Pro, 52,5 w OSWorld-G i 83,2 w V* bez dodatkowych narzędzi. Dla porządku odnotowujemy drobną niespójność: streszczenie na początku karty modelu podaje MMVet 78,4, a tabela porównawcza dwa akapity niżej — 78,1 dla tego samego modelu i tego samego testu. Pozostałe liczby w karcie są ze sobą zgodne, a porównanie prowadzone jest z Qwen2.5-VL-7B i Gemmą 3 12B; GPT-4o pokazano wyłącznie poglądowo i jest to w karcie wyraźnie zaznaczone. Wagi są na Hugging Face na licencji MIT; producent nie prowadzi dla tego modelu płatnego punktu dostępowego, więc jest to wydanie do pobrania i uruchomienia u siebie. Raport techniczny to arXiv:2504.07491.

#open weights#mixture of experts#vision#reasoning#MIT licence
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję