MDL-6179EST.2025 · IDX.049
Model językowyW produkcji

Tongyi DeepResearch 30B-A3B

Alibaba Cloud · China · 2025

Model o otwartych wagach zbudowany do jednego zadania: godzinnego szukania w sieci i spisania tego, co znalazł. Ma 30 miliardów parametrów, ale zużywa 3 miliardy na token, a Alibaba twierdzi, że dorównuje Deep Research od OpenAI w czterech testach wyszukiwania.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Tongyi DeepResearch 30B-A3B, opublikowany 16 września 2025 roku, nie jest czatem z przyciskiem wyszukiwania. Został wyuczony od początku do końca do długiego poszukiwania informacji: zadaj zapytanie, przeczytaj wyniki, zadaj następne i tak przez dziesiątki kroków, zanim powstanie odpowiedź. Alibaba przedstawia go jako pierwszego w pełni otwartego agenta sieciowego, który dorównuje usłudze Deep Research od OpenAI — a tej nie da się pobrać za żadne pieniądze. Architektura to mieszanka ekspertów: 48 warstw, wymiar ukryty 2048, 128 ekspertów, z których 8 uruchamia się na token, co daje 30 miliardów parametrów na dysku i około 3 miliardów w użyciu w danej chwili. Okno ma 131 072 tokeny — to wymóg praktyczny, nie przechwałka, bo agent wyszukujący zbiera w jednym przebiegu stronę po stronie pobranego tekstu. Model pracuje w dwóch trybach: zwykłym ReAct, którym producent mierzy jego własne zdolności, oraz cięższym trybie iteracyjnym, który dokłada obliczeń przy odpowiadaniu, żeby podnieść sufit możliwości. Wyniki producenta: 32,9 w teście Humanity's Last Exam, 43,4 w BrowseComp i 46,7 w jego chińskim odpowiedniku BrowseComp-ZH oraz 75 w xbench-DeepSearch. Jak zawsze przy testach agentowych, wynik zależy od rusztowania wokół modelu tak samo jak od samych wag, a są to pomiary własne producenta. Najciekawsze przyznanie kryje się w notatkach inżynierskich. Alibaba uczyła model głównie na zadaniach syntetycznych z własnego potoku i podaje, że uczenie wprost na zbiorze testowym BrowseComp dało wyniki istotnie gorsze niż uczenie na danych syntetycznych. Tłumaczy to tym, że dane agentowe opisane przez ludzi są zaszumione i zbyt nieliczne, by dało się z nich odtworzyć wyuczalny rozkład. To rzadki przypadek, gdy producent publikuje wynik negatywny dotyczący oczywistej drogi na skróty. Wagi są na Apache 2.0, a skrypty uruchomieniowe w osobnym repozytorium na GitHubie. Popularność w 30 dniach do 23 września 2026: 29 537 pobrań przy 821 polubieniach — proporcja właściwa modelowi bardziej podziwianemu niż wdrażanemu, co pasuje do trzydziestomiliardowego agenta, który bez zbudowanej wokół niego wyszukiwarki nie zrobi zupełnie nic.

#open weights#agents#web search#reasoning#mixture of experts#China
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję