MDL-8258EST.2025 · IDX.346
Model językowyW produkcji

Ling-1T

InclusionAI (Ant Group) · China · 2025

Pierwszy bilionowy model o otwartych wagach z badawczego ramienia grupy Ant — i taki, który odpowiada bez rozpisywania rozumowania, z założenia, a nie z braku.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Ling-1T, opublikowany 2 października 2025 r., był pierwszym modelem o bilionie parametrów z InclusionAI, otwartoźródłowego ramienia grupy Ant, i otworzył linię, którą później kontynuowały opisane w katalogu Ring-2.6-1T oraz modele Ling 3.0. To z założenia model bez trybu rozumowania. Podczas gdy większość flagowych premier końca 2025 r. ścigała się na coraz dłuższe łańcuchy rozumowania przed udzieleniem odpowiedzi, ten dostrojono tak, by odpowiadał wprost — i producent robi z tego sedno sprawy: twierdzi, że przesuwa całą krzywą wymiany między trafnością a długością rozumowania, zamiast wspinać się po niej. Stoi za tym metoda trenowania nazwana Evo-CoT, czyli narastający program łańcuchów myśli stosowany w środkowej i końcowej fazie treningu, a po nim uczenie ze wzmocnieniem prowadzone na poziomie całych zdań, a nie tokenów czy sekwencji — tę metodę zespół nazwał LPO. Wagi to mieszanka ekspertów o współczynniku aktywacji jeden do trzydziestu dwóch: na każdym tokenie pracuje około 50 miliardów parametrów. Opublikowany indeks plików wag liczy 999,71 miliarda parametrów, okrągły bilion w nazwie jest więc pułapem, a nie pomiarem. Trening wstępny objął ponad 20 bilionów tokenów, z czego w późniejszych fazach ponad 40 procent stanowiły dane nasycone rozumowaniem. Okno kontekstu to 32 768 tokenów natywnie i 131 072 po rozszerzeniu metodą YaRN. Producent podaje, że jest to największy jak dotąd model podstawowy wytrenowany w precyzji FP8, czemu przypisuje 15-procentowe przyspieszenie całego procesu i odchylenie straty poniżej 0,1 procenta wobec BF16. Jedna rzecz, o której czytelnik powinien wiedzieć, zanim zajrzy do karty modelu: nie ma w niej żadnej tabeli wyników. Każdy rezultat jest wykresem w postaci grafiki — a karta podaje, że te wykresy narysował sam Ling-1T, jako pokaz jego umiejętności generowania kodu interfejsu. Jedyne liczby podane słowem to około 70 procent trafności wywołań narzędzi w teście BFCL v3, osiągnięte przy lekkim dostrojeniu do instrukcji i bez dużego zbioru zapisów działań, oraz pierwsze miejsce wśród modeli otwartych w teście ArtifactsBench. Oba twierdzenia pochodzą od wydawcy. Sytuacja licencyjna jest tu taka jak zwykle u tego wydawcy i warto powiedzieć to wprost: etykieta w metadanych wskazuje MIT, w treści karty nie ma sekcji o licencji w ogóle, a w repozytorium nie ma pliku licencji wśród 165 plików. Uruchomienie modelu wymaga klastra — własna instrukcja producenta zakłada cztery węzły po osiem akceleratorów. Liczba pobrań jest odpowiednio skromna: około 2,5 tysiąca w 30 dniach do 29 sierpnia 2026 r., przy 544 polubieniach repozytorium.

#open weights#MoE#trillion parameters#MIT#128K context#FP8
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję