MDL-5038EST.2026 · IDX.924
Model językowyW produkcji

Ling-3.0-tiny

InclusionAI (Ant Group) · China · 2026

Mały brat rodziny Ling-3.0 od grupy Ant: 7,9 mld parametrów, 1,3 mld aktywnych na token i zapotrzebowanie mieszczące się w laptopie.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Ling-3.0-tiny to lekki członek bieżącej rodziny InclusionAI, opublikowany na Hugging Face 10 sierpnia 2026 r., osiem dni po większym modelu Ling-3.0-flash. Zachowuje ten sam przepis na uwagę hybrydowo-liniową i zmniejsza go mniej więcej szesnastokrotnie: 7,9 miliarda parametrów łącznie wobec 124 miliardów i 1,3 miliarda aktywowanych na token wobec 5,1 miliarda. Indeks plików wag potwierdza liczbę z nagłówka — 7,89 miliarda. Sensem tego modelu jest to, gdzie da się go uruchomić. InclusionAI podaje, że sprawdziło go na komputerze NVIDIA DGX Spark, na MacBooku z układem Apple Silicon i na Mac mini, i podaje około 8,34 GiB szczytowego zużycia pamięci przy kontekście 8 tys. tokenów w formacie FP8 — czyli mieści się w konsumenckiej maszynie z 16 GB pamięci, a nie w centrum danych. Na tym sprzęcie producent mierzy od 100 do 105 tokenów na sekundę na DGX Sparku i od 86 do 90 na MacBooku z układem M4 Pro. Od strony architektury model przeplata trzy warstwy Kimi Delta Attention z jedną bramkowaną warstwą uwagi utajonej w każdym bloku czterowarstwowym — przy 24 warstwach daje to 18 warstw KDA na 6 warstw MLA. Większy model flash używa proporcji 5:1. Warstwę przetwarzającą stanowi rzadka mieszanka 128 ekspertów, z których każdy token uruchamia 8, plus jeden ekspert wspólny. Reklamowane okno 256 tys. tokenów wymaga przypisu. Plik konfiguracyjny w repozytorium deklaruje natywne okno 131 072 tokenów; liczba 262 144 podawana w karcie modelu i używana w jego własnych testach osiągana jest przez włączenie ekstrapolacji YaRN ze współczynnikiem 2,0 przy uruchamianiu serwera. Kto uruchomi model bez zmian, dostanie połowę wartości z nagłówka. W niezależnym zestawie Artificial Analysis producent raportuje wynik 25 w indeksie inteligencji v4.1.1 i 16 w indeksie agentowym, przy prędkości powyżej 160 tokenów na sekundę i około 18 sekundach od zapytania do pełnej odpowiedzi o długości 500 tokenów, wliczając czas myślenia. Tryb rozumowania jest domyślnie włączony i można go wyłączyć w pojedynczym zapytaniu. Podobnie jak w reszcie rodziny, licencja MIT istnieje wyłącznie jako linijka metadanych w karcie modelu — w repozytorium nie ma osobnego pliku licencji. W pierwszym miesiącu model pobrano około 17 300 razy, blisko wyniku 18 600 szesnastokrotnie większego modelu flash. Mały model jest więc brany niemal tak samo chętnie jak duży.

#open weights#MIT license#MoE#reasoning#on-device#256K context
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję