MDL-5043EST.2025 · IDX.128
Model językowyW produkcji

Kimi Linear 48B A3B Instruct

Moonshot AI · China · 2025

Architektoniczny eksperyment Moonshot AI: otwarty model o 48 mld parametrów, który trzy czwarte warstw uwagi zastępuje tańszą wersją liniową i wciąż czyta milion tokenów naraz.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Kimi Linear, opublikowany 30 października 2025 r., nie jest flagowym modelem do rozmowy, lecz sprawdzianem architektury uwagi, którą Moonshot AI chciał zweryfikować przed użyciem jej w większej skali. Zwykły transformer porównuje każdy token z każdym innym, przez co długie wejścia kosztują i pamięć, i czas. Kimi Linear zastępuje trzy z czterech warstw uwagi mechanizmem Kimi Delta Attention (KDA) — dopracowaną bramkowaną regułą delta, która trzyma pamięć o stałym rozmiarze zamiast rosnącego bufora — a pełną uwagę MLA zostawia tylko w siedmiu z dwudziestu siedmiu warstw. Pozostałe dwadzieścia działa na KDA. Na tym stoi mieszanka ekspertów: 256 ekspertów, ośmiu uruchamianych na token plus jeden współdzielony, więc 48 miliardów parametrów łącznie kosztuje około 3 miliardów na token. Okno kontekstu ma 1 048 576 tokenów, a opublikowane wagi mieszczą 49,1 miliarda parametrów. Sensem tego wydania jest koszt, a liczby producenta mówią o szybkości, nie o inteligencji: do 75 procent mniejszy bufor klucz-wartość, do sześciu razy szybsze generowanie przy kontekście miliona tokenów i 3,98-krotne przyspieszenie przy 128 tys. tokenów, przy wyniku 84,3 w teście RULER. Przy krótkim kontekście 4 tys. karta podaje 51,0 w MMLU-Pro i przedstawia to jako zrównanie z pełną uwagą, a nie przewagę. Obok głównej deklaracji trzeba postawić zastrzeżenie. Moonshot pisze, że architektura bije pełną uwagę, powołując się na kontrolowane przebiegi treningowe na 1,4 biliona tokenów, ale wydane punkty kontrolne trenowano na 5,7 biliona. Porównanie i model do pobrania to zatem dwa różne eksperymenty, a bliźniaczej wersji wydanych wag z pełną uwagą, na której można by to sprawdzić, nie ma. Wagi wersji bazowej i instrukcyjnej są na Hugging Face na licencji MIT, a jądro KDA producent udostępnił w bibliotece FLA; płatnego punktu dostępowego Moonshota dla tego modelu nie ma, więc użycie oznacza własne wdrożenie. Architekturę opisuje publikacja arXiv:2510.26692.

#open weights#mixture of experts#linear attention#long context#MIT licence
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję