Ling-mini-2.0
InclusionAI (Ant Group) · China · 2025
Mały model, który otworzył architekturę Ling 2.0 grupy Ant — 16 miliardów parametrów, z czego na jeden token pracuje 1,4 miliarda; wciąż najczęściej pobierany zwykły model tego wydawcy.
Ling-mini-2.0 to model, który 8 września 2025 r. wprowadził architekturę Ling 2.0 — i stoi na niej wszystko, co InclusionAI wydał później: bilionowe Ling-1T i Ring-1T, hybrydowe Ring-2.5-1T i Ring-2.6-1T oraz linia dyfuzyjna LLaDA, która powiela dokładnie jego wymiary. W liczbach pobrań pozostaje też najczęściej używanym zwykłym modelem tego wydawcy: 13 058 pobrań w ciągu 30 dni do 29 sierpnia 2026 r., czyli więcej niż wszystkie jego bilionowe rodzeństwo razem wzięte. Pomysłem konstrukcyjnym jest skrajna rzadkość aktywacji. Model mieści 16,26 miliarda parametrów, ale na jeden token uruchamia 1,43 miliarda, a poza warstwami osadzeń zaledwie 789 milionów — co daje współczynnik aktywacji jeden do trzydziestu dwóch. Producent twierdzi, opierając się na własnych opublikowanych prawach skalowania, że kupuje to około siedmiokrotną dźwignię: model z 1,4 miliarda parametrów aktywnych pracuje jak model gęsty o wielkości 7–8 miliardów. Decyzje, które za tym stoją, są wymienione otwarcie — ziarnistość ekspertów, wspólny ekspert, routing sigmoidalny bez funkcji pomocniczej, warstwy przewidywania wielu tokenów naraz, normalizacja QK i połowiczne RoPE. Trening objął ponad 20 bilionów tokenów, po nim etapowe dostrajanie nadzorowane i uczenie ze wzmocnieniem. Okno kontekstu ma natywnie 32 768 tokenów i 131 072 metodą YaRN. Praktycznym atutem jest szybkość. Przy krótkich odpowiedziach, poniżej 2000 tokenów, producent mierzy ponad 300 tokenów na sekundę na układach H20 — ponad dwa razy więcej niż model gęsty o wielkości 8 miliardów — i podaje, że przewaga rośnie do siedmiokrotnej wraz z długością sekwencji. Cały trening prowadzono w mieszanej precyzji FP8, z krzywymi strat opisanymi jako niemal identyczne z BF16 na przestrzeni biliona tokenów, a sam przepis na trening w FP8 udostępniono jako otwarty. To wydanie jest nietypowo hojne wobec badaczy, a nie wobec użytkowników. Obok gotowego modelu wydawca opublikował pięć punktów kontrolnych z pretreningu — model bazowy sprzed dostrajania oraz cztery migawki zrobione po 5, 10, 15 i 20 bilionach tokenów treningu. Bardzo niewielu producentów publikuje pośrednie etapy treningu, a to właśnie one pozwalają badaczom z zewnątrz sprawdzić, jak zdolności modelu powstają, a nie tylko jakie są na końcu. Licencja układa się według zwyczaju tego wydawcy. Metadane repozytorium noszą etykietę MIT, ale wśród 14 plików repozytorium z wagami nie ma żadnego dokumentu licencyjnego; oświadczenie licencyjne mieszka w osobnym projekcie kodu na GitHubie. Dostęp bez pobierania wag prowadzi przez pośrednika ZenMux.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!