Newsy
Co słychać w robotyce i AI — wybór redakcji wujec.ai.
Nowy model DeepSeeka bije Opusa i GPT w teście agentowym, w którym czołówka już się stłoczyła. W dwóch trudniejszych wersjach tego samego testu przegrywa o dwadzieścia punktów
DeepSeek opublikował 10 września 2026 roku model V4.1-Flash wraz z tabelą porównawczą, która wygląda na zwycięstwo na całej linii — dopóki nie prześledzi się jednego testu przez trzy jego wersje. W Terminal-Bench 2.1 nowy model uzyskuje 90,6 punktu, przed Opus-5.0 z 89,1 i GPT-5.6 Sol z 88,8. W Terminal-Bench 3.0 dostaje 30,0 wobec 43,3 dla Opus-5.0. W wersji 4.0 — 31,2 wobec 51,8. Te trzy liczby opisują ten sam model na tej samej rodzinie zadań, a rozrzut między nimi jest lekcją czytania testów. Wersja 2.1 krąży na tyle długo, że każde poważne laboratorium notuje w niej wynik pod dziewięćdziesiąt; przewaga półtora punktu dzieli tam modele w praktyce równie sprawne. Wersje 3.0 i 4.0 to trudniejsze odsłony napisane właśnie dlatego, że stara przestała modele rozróżniać — i tam dystans między modelem DeepSeeka a najdroższym modelem zachodnim wynosi około dwudziestu punktów. Ten sam wzór powtarza się w innych miejscach tabeli. W teście Humanity's Last Exam, wciąż dalekim od nasycenia, V4.1-Flash osiąga 36,8 wobec 56,3 dla Opus-5.0. W ProgramBench — 20,3 wobec 37,0. To, co model rzeczywiście wygrywa, warto powiedzieć wprost, bo nie jest to drobiazg. Jego ranking 3471 punktów w Codeforces jest najwyższy w tabeli. Rozwiązuje 74,2 procent zadań DeepSWE v1.1, prowadzi w CyberGym z wynikiem 88,1 i w AutomationBench z 54,8. A robi to, uruchamiając 8 miliardów parametrów na token przy czytaniu polecenia i 16 miliardów przy pisaniu odpowiedzi — z 552 miliardów w szkielecie. Właściwą wiadomością jest ta oszczędność. DeepSeek przebudował tę część modelu, która przechowuje przebieg rozmowy, i ściął pamięć trzymaną na jeden token do 890 bajtów, czyli około jednej czwartej tego, czego potrzebował model z lipca. Przez API firmy nowy model kosztuje 0,30 dolara za milion tokenów wejściowych w szczycie i 1,20 dolara za milion wyjściowych, wobec 0,44 i 1,32 dolara u poprzednika, a poza godzinami szczytu — połowę tego. Wagi są na licencji MIT i w kolejnych tygodniach pobrano je 140 636 razy. Czytana w całości tabela mówi coś pożyteczniejszego niż „najlepszy model”. Do pracy agentowej na dużą skalę, gdzie sesja na milion tokenów musi się zmieścić w budżecie, jest to narzędzie znakomite i za ułamek ceny czołówki. Do najtrudniejszego rozumowania, jakie da się dziś postawić, drogie modele pozostają z przodu — i mówią to liczby samego DeepSeeka.
DeepSeek-V4.1-Flash →Dwie trzecie repozytoriów Z.ai jest starszych niż rok 2025. Jedno z nich zbiera większość tego, co z ich ruchu zostało.
Z.ai utrzymuje na Hugging Face 154 repozytoria modeli. Dziewięćdziesiąt osiem z nich — niecałe dwie trzecie — opublikowano przed 2025 rokiem, a przez ostatnie trzydzieści dni pobrano je łącznie 810 718 razy. To osiem procent z 10,08 mln pobrań całego konta. Czternaście repozytoriów założonych w 2026 roku zebrało 8,38 mln, czyli osiemdziesiąt trzy procent. Zaskakuje to, jak bardzo skupiona jest reszta. Sam ChatGLM2-6B, opublikowany w czerwcu 2023 roku, odpowiada za 435 810 tych pobrań — czyli za ponad połowę wszystkiego, co zbiera archiwum sprzed 2025 roku, i za więcej, niż w tym samym czasie pobiera się z osobna aktualne GLM-5, GLM-5.1, GLM-5.3 czy GLM-4.7. Trzyletni sześciomiliardowy czat-model wyprzedza w liczniku pobrań cztery flagowce własnej firmy. Czytelnym wyjaśnieniem jest rozmiar. ChatGLM2-6B po kwantyzacji INT4 działa na karcie graficznej z 6 GB pamięci i mieści tam około ośmiu tysięcy tokenów rozmowy; flagowce z 2026 roku nie mieszczą się na domowym sprzęcie w ogóle. Reszta to bezwład: poradniki, materiały do zajęć na uczelniach i przepisy na dostrajanie pisane w 2023 roku wciąż wskazują to repozytorium z nazwy. Do liczb należy jedno zastrzeżenie. Hugging Face podaje pobrania wyłącznie z ruchomego okna trzydziestu dni, więc opisują one dzisiejszy ruch, a nie sumę od premiery — model sprzed tygodnia i model sprzed trzech lat mierzone są tym samym miesiącem. W wujec.ai przybyły profile ChatGLM-6B, ChatGLM2-6B i GLM-4-9B-Chat, czyli trzech modeli, przez które ta historia przebiega.
ChatGLM2-6B →Nowy model animacji Alibaby powstał z myślą o wideo na żywo — i akurat wersji do żywego jako jedynej nie wydano
Alibaba opublikowała Wan2.2-Animate-2-14B 7 sierpnia 2026 na licencji Apache 2.0: wagi, kod uruchomieniowy, a dzień później publikację naukową. Model animuje nieruchomą postać na podstawie nagrania wzorcowego z grającym człowiekiem, a inżyniersko jest to prawdziwa przebudowa, nie odświeżenie. Pierwsza generacja wyodrębniała z nagrania szkielet pozy i dopiero jego podawała generatorowi; publikacja samego zespołu nazywa wady tego rozwiązania wprost — błędy wyodrębniania wędrują do wyniku, a tożsamość postaci rozjeżdża się w miarę trwania ujęcia. Animate-2 usuwa ten etap i podaje nagranie wzorcowe wprost do przebudowanego transformatora dyfuzyjnego. Sama publikacja stawia jednak sprawę nie na wierności, lecz na czasie. Zaczyna od stwierdzenia, że wszystkie istniejące systemy tego rodzaju działają poza czasem rzeczywistym i nie nadają się do zastosowań interaktywnych, takich jak cyfrowe awatary czy prowadzący transmisje na żywo. Odpowiedzią ma być Wan-Animate-2-Lite, wariant uczony trzystopniowo — wstępnie z wymuszaniem nauczyciela i buforem błędu, potem destylacją Self-Forcing z propagacją wsteczną po blokach — po to, by zejść z opóźnieniem do progu pracy na żywo. Na tej obietnicy kończy się streszczenie. Wariantu Lite w repozytorium nie ma. Są dwa pliki wag identycznej wielkości, po 32,8 GB: wersja podstawowa, wykonująca 40 kroków odszumiania ze wsparciem klasyfikatora, i destylowana, dochodząca do obrazu w 10 krokach bez tego wsparcia. Destylacja czyni model działający poza czasem rzeczywistym mniej więcej czterokrotnie tańszym w próbkowaniu; nie jest architekturą strumieniową opisaną w publikacji. Brak nie wygląda też na kolejkę: lista zapowiedzianych prac na karcie modelu ma odhaczone wszystkie pozycje — kod, wagi, integracje z Diffusers, DiffSynth-Studio i ComfyUI — a Lite nie figuruje na niej wcale. W tę samą stronę wskazuje drobiazg. W bloku cytowania na dole karty stoi wciąż niewypełnione miejsce w numerze publikacji, choć poprawny numer widnieje w plakietce na górze tego samego pliku. To wydanie przygotowano szybko. Czytelnik może za to wyciągnąć wniosek z rzeczy zwyczajnej. Liczniki pobrań pokazują, że popyt idzie za szybkością, nie za jakością: w przeróbkach do formatu Diffusers, opublikowanych dzień przed premierą, wersja destylowana pobierana jest mniej więcej trzy razy częściej niż pełnej jakości. Pierwsza generacja Animate jest tymczasem wciąż pobierana o rząd wielkości częściej niż obie te wersje — co zwykle się zdarza w pierwszym miesiącu modelu, który zmienia sposób sterowania. Repozytorium podstawowe wykazuje zero pobrań przy 185 zakładkach, ale ten licznik pokazuje zero dla repozytoriów wydających surowe pliki wag zamiast standardowej konfiguracji, więc mówi raczej o sposobie pobierania niż o zainteresowaniu.
Wan2.2-Animate-2-14B →Każda karta modelu Wan 2.2 odsyła czytelnika do pliku licencji, którego w repozytorium nie ma
Modele wideo Wan 2.2 Alibaby kończą swoje karty tym samym akapitem: wagi są na licencji Apache 2.0, firma nie rości sobie praw do tego, co użytkownik wygeneruje, a po „pełną listę ograniczeń i szczegóły dotyczące przysługujących praw" należy sięgnąć do pełnego tekstu licencji — przy czym słowo „licencja" prowadzi do pliku LICENSE.txt w repozytorium. Tego pliku tam nie ma. Sprawdziliśmy 2 września 2026 roku wszystkie cztery repozytoria z wagami Wan 2.2: T2V-A14B, I2V-A14B, S2V-14B i Animate-14B zwracają dla LICENSE.txt błąd 404. Dwa sprawdzone repozytoria Wan 2.1, T2V-14B i T2V-1.3B, plik zawierają, z pełnym standardowym tekstem Apache 2.0. Praktyczny skutek jest mniejszy, niż to brzmi, ale nie jest żaden. W mocy pozostają dwie niezależne deklaracje Apache 2.0: znacznik licencji w metadanych repozytorium na Hugging Face, czyli to, co wyświetla sam serwis i co czytają automatyczne skanery licencji, oraz plik licencji w odpowiadającym mu repozytorium kodu Alibaby na GitHubie. Kto buduje produkt na tych wagach, licencję ma. Nie ma natomiast dokumentu, do którego karta modelu każe mu zajrzeć — tego, który według niej zawiera komplet ograniczeń. Wagi tej sprawie dodaje moment. Wan 2.2 to ostatnia generacja linii wideo Alibaby, której wagi w ogóle opublikowano; wszystko późniejsze — 2.5, 2.6, 2.7 i Wan3.0 — działa wyłącznie przez API. Te cztery repozytoria nie są więc archiwum. To pliki, które dziś pobiera każdy, kto chce Wana uruchamianego na własnym sprzęcie, a jedno z nich, Animate-14B, jest najczęściej zakładkowanym modelem wideo w historii tej firmy.
Wan2.2-Animate-14B →Mistral nie sprzedaje już modelu rozumującego: cała linia Magistral trafiła do tabeli wycofań
W czerwcu 2025 Mistral AI wypuścił Magistrala — własną rodzinę modeli, które przed odpowiedzią rozpisują tok rozumowania. Piętnaście miesięcy później rodziny nie ma już w API producenta. Wszystkich sześciu członków — Magistral Small 1.0, 1.1 i 1.2 oraz Magistral Medium 1.0, 1.1 i 1.2 — wymienia tabela wycofań we własnej dokumentacji firmy. Dwa ostatnie wyłączono 31 lipca 2026. Następcy wskazani w tej tabeli nie są kolejnym modelem rozumującym. Użytkowników Magistrala Small kieruje się do Mistral Small 4, użytkowników wersji Medium do Mistral Medium 3.5 — obu zwykłych modeli z głównej linii. Rozumowanie nie zniknęło z oferty; przestało być osobnym produktem. Od grudnia 2025 rodzina Ministral 3 wychodzi w trzech odmianach każdego rozmiaru — bazowej, instrukcyjnej i rozumującej — więc klient, który chce rozważania, wybiera wariant standardowego modelu zamiast innego modelu. To prawidłowość warta nazwania, bo Mistral nie jest w niej sam. Osobna linia rozumująca miała sens, dopóki technika była nowa i dość kosztowna, by sprzedawać ją drożej. Kiedy stała się etapem uczenia, przez który można przeprowadzić dowolny model, utrzymywanie równoległej rodziny oznaczało prowadzenie dwóch katalogów tych samych rozmiarów. Nietypowe w tej sprawie jest to, że wyłączenie modelu w API nie wyłączyło go w świecie. Magistral Small 1.0, wycofany z usługi producenta 30 listopada 2025, został pobrany z Hugging Face około 80 700 razy w ciągu trzydziestu dni do początku września 2026 — ponad sześć razy częściej niż finalna wersja 1.2, technicznie lepsza. Devstral Small 2 pokazuje to jeszcze dobitniej: wycofany z API 31 marca 2026, w tym samym okienku zebrał około 229 700 pobrań, dwanaście razy więcej niż flagowiec o 123 miliardach parametrów, z którym go wydano. Liczniki obejmują tylko trzydzieści dni, a starsze wydania mają przewagę — poradniki, skwantyzowane odgałęzienia i gotowe potoki, które napisano raz i które wciąż na nie wskazują. Kierunek jest jednak dość wyraźny. W firmie publikującej wagi na licencji Apache 2.0 wycofanie mówi o tym, co producent chce hostować, a nie o tym, czego ludzie używają. Dlatego założone dziś profile Magistrala Small 1.2 i Devstrala Small 2 są oznaczone jako historyczne, a jednocześnie opisują, jak te modele uruchomić — skończyła się usługa, nie oprogramowanie.
Magistral Small 1.2 →Z.ai otworzył wagi taniego modelu — flagowca obiecanego dwa tygodnie temu wciąż nie ma do pobrania
Z.ai opublikował GLM-5.3-Flash 26 sierpnia 2026 i w tym samym tygodniu wystawił jego wagi na Hugging Face, na czystej licencji MIT. Dwa tygodnie wcześniej firma wypuściła flagowy model GLM-5.3 z obietnicą, że wagi pojawią się mniej więcej po dwóch tygodniach. Termin właśnie minął, a repozytorium flagowca nie istnieje: najnowszym modelem Z.ai, który każdy może pobrać, jest ten tani. Ostatnim flagowcem z faktycznie opublikowanymi wagami pozostaje GLM-5.2 z czerwca 2026, liczący 753,3 miliarda parametrów. GLM-5.3-Flash jest od niego ponad dwukrotnie mniejszy — 320 miliardów parametrów, z czego 18 miliardów aktywnych na token, co potwierdza opublikowany indeks wag: 321,3 miliarda. Mniejszy model nie jest przy tym okrojoną wersją większego. Z.ai przedstawia go jako pierwszy model czołowej klasy z otwartymi wagami, który łączy uwagę rzadką z liniową, i podaje zysk w liczbach: obliczenia uwagi spadają 3,01 raza, a pamięć podręczna KV 4,44 raza wobec GLM-5.3. To również pierwszy natywnie multimodalny model rodziny, czyli taki, który potrafi obejrzeć wyrenderowany interfejs i poprawić własny kod, zamiast pisać go na ślepo. Architektura widać po cenie. GLM-5.3-Flash kosztuje katalogowo 0,15 dolara za milion tokenów wejścia i 0,50 dolara za milion wyjścia; GLM-5.3 kosztuje 1,40 i 4,40. To 9,3 raza taniej na wejściu i 8,8 raza taniej na wyjściu — blisko, ale jednak nie tyle, ile firma nazywa jedną dziesiątą ceny. Do 9 września 2026 obowiązuje promocja 50 procent, która na razie podwaja tę różnicę. Deklaracje o skuteczności pozostają wyłącznie po stronie producenta. Z.ai twierdzi, że model bije GLM-5.2 we wszystkich testach i zbliża się do Claude Opus 4.8 w zadaniach programistycznych i agentowych, ale wyniki publikuje tylko jako obrazek z wykresem, a żadne niezależne laboratorium ich nie powtórzyło. Zweryfikować można za to licencję: plik LICENSE w repozytorium to goły tekst MIT, bez dopisku o atrybucji i bez ograniczenia użytku komercyjnego.
GLM-5.3-Flash →Otwarte wagi przestały pytać o zgodę — wśród czterdziestu najczęściej pobieranych modeli konta wymagają już tylko modele Mety
Przeczytaliśmy dziś, 25 sierpnia 2026, licencję każdego repozytorium z czterdziestu najczęściej pobieranych modeli językowych na Hugging Face i sprawdziliśmy, czy wagi w ogóle da się pobrać. Bramkę ma dwa z czterdziestu: Llama-3.2-1B-Instruct i Llama-3.1-8B-Instruct Mety, które wymagają konta, akceptacji regulaminu i ręcznej zgody. Trzeci taki przypadek to Gemma 3 1B Google'a. Cała reszta listy pobiera się bez konta. Zmiana, która to sprawiła, jest świeża i należy do Google'a. Gemmy 3, wydanej na własnych warunkach firmy, nie dało się pobrać ani nawet przeczytać treści jej licencji bez zalogowania — żądanie pliku zwraca kod 401. Gemma 4, opublikowana 11 marca 2026, stoi na zwykłej licencji Apache 2.0 i bramki nie ma wcale. Nie jest to model marginalny: samo repozytorium wersji instrukcyjnej 31B notuje 8,79 miliona pobrań w trzydzieści dni, więcej niż jakikolwiek inny śledzony przez nas model o otwartych wagach z górnej półki. To, co zostało z licencji autorskich, jest węższe, niż głosi ich reputacja. Kimi K2 firmy Moonshot ma licencję „zmodyfikowany MIT", w której jedyną modyfikacją jest obowiązek wyświetlania: produkt mający ponad 100 milionów użytkowników miesięcznie albo ponad 20 milionów dolarów miesięcznego przychodu musi pokazać w swoim interfejsie napis „Kimi K2". Z kolei DeepSeek-V3, model, na którym stoi cała linia tej firmy, wciąż bywa opisywany jako model na licencji MIT — i nim nie jest. W jego repozytorium leży MIT dla kodu i osobna umowa licencyjna DeepSeeka dla wag. Dopiero od marca 2025 firma przeniosła same wagi na MIT. Jeden nawyk wart jest ostrzeżenia dla każdego, kto bierze etykietę za dobrą monetę. Kilka intensywnie pobieranych repozytoriów deklaruje licencję w metadanych karty, a pliku licencji nie zawiera wcale; kopie skwantyzowane dziedziczą zaś etykietę z karty modelu, a nie z pierwotnych warunków. Etykieta to metadana, plik to umowa. Gdy się różnią, wiążący jest tylko jeden z nich.
Gemma 4 31B →Najczęściej pobierany model MiniMaxa jest jedynym, na którym nie wolno nic zarobić
MiniMax M2.7 pobierany jest z Hugging Face około 909 tysięcy razy miesięcznie — częściej niż jakikolwiek inny model tekstowy tego chińskiego laboratorium i ponad czterokrotnie częściej niż jego własny następca M3. Jest też jedynym w rodzinie, który zakazuje użytku komercyjnego. Plik licencji dołączony do wag nosi tytuł „Non-Commercial License”. Użytek osobisty, uruchamianie na własnym sprzęcie, badania i eksperymenty są wprost darmowe. Cała reszta nie: sprzedaż produktu lub usługi opartej na modelu, wystawienie go za płatnym API czy wdrożenie dotrenowanej odmiany w celach zarobkowych wymagają wcześniejszej pisemnej zgody MiniMaxa, o którą występuje się mailowo. Kto taką zgodę otrzyma, musi dodatkowo umieścić w produkcie widoczny napis „Built with MiniMax M2.7”. Ten warunek jest wyjątkiem, a nie kierunkiem. MiniMax M2 (październik 2025) i M2.1 (grudzień 2025) wyszły na licencji MIT z jednym dopiskiem: komercyjny produkt oparty na modelu musi pokazywać w interfejsie nazwę modelu. W M2 obowiązek zaczyna się dopiero powyżej 100 mln aktywnych użytkowników miesięcznie albo 30 mln USD rocznych przychodów powtarzalnych; w M2.1 nie ma żadnego progu. M2.5 (luty 2026) przeszedł na własną licencję modelową producenta, która nadal pozwala na rozpowszechnianie, ale wymaga, by z każdą kopią wędrowała ustalona nota atrybucyjna. M2.7, wydany miesiąc później, zamknął użytek komercyjny całkowicie. M3 z czerwca 2026 znów go otworzył — na licencji społecznościowej dopuszczającej wdrożenia zarobkowe w zamian za widoczną atrybucję. Skutek praktyczny łatwo przeoczyć, bo strona pobierania niczym go nie sygnalizuje. Cztery modele tej linii dzielą ten sam korpus — 62 warstwy, 256 ekspertów, ośmiu aktywnych na token, a M2, M2.1 i M2.7 mają co do bajta 228 689 764 864 parametrów. Zespół, który podmienia jeden na drugi jako zwykłą aktualizację, zmienia swoją sytuację prawną, nie zmieniając ani linijki kodu. Najmocniejszym modelem tej linii do swobodnego użytku pozostaje M2.5; najmocniejszym w ogóle, według tabeli benchmarków samego producenta, jest ten, który wymaga podpisu. wujec.ai dodał dziś do katalogu profile M2.1, M2.5 i M2.7, w każdym opisując warunki licencji.
MiniMax M2.7 →Mistral zbudował markę na swobodnie licencjonowanych wagach — największe wciąż pochodzą z modelu wydanego w kwietniu 2024
Mistral AI stał się rozpoznawalną marką we wrześniu 2023 roku, publikując model o 7,3 miliarda parametrów na licencji Apache 2.0 — takiej, która pozwala każdemu pobrać wagi, douczyć je i sprzedawać efekt komercyjnie, nie pytając nikogo o zgodę. Trzy miesiące później Mixtral 8x7B powtórzył ten manewr w rozmiarze, który się liczył: 46,7 miliarda parametrów w pamięci, 12,9 miliarda zużywanych na token, wyniki na poziomie Llamy 2 70B oraz bazowego GPT-3.5, który obsługiwał wtedy darmowy ChatGPT. W kwietniu 2024 Mixtral 8x22B przeskalował tę samą rzadką architekturę do 141 miliardów parametrów, z czego 39 miliardów pracuje przy każdym tokenie, przy oknie 64 tysięcy tokenów i wbudowanym wywoływaniu funkcji. Także on wyszedł na Apache 2.0. Tamto kwietniowe wydanie z 2024 roku to wciąż największy model, jaki Mistral kiedykolwiek otworzył. Wszystko powyżej zmieniło warunki: Mistral Large 2.1 z listopada 2024 udostępnił wagi na licencji badawczej Mistral Research License, a licencję komercyjną sprzedawano osobno; późniejszych flagowców nie otwierano już w ten sposób. Firma, która ze swobodnego licencjonowania uczyniła znak rozpoznawczy, nadal publikuje otwarte wagi — ale na dole i w środku oferty, podczas gdy jej górna półka przeszła na warunki komercyjne. Praktyczna konsekwencja jest taka, że licencji Apache 2.0 nie da się cofnąć. Mixtral 8x22B zniknął z oferty API samego Mistrala, w której figurują dziś Large 3, Medium 3.5, Small 4 i Ministral 3, a daty wyłączenia firma nigdy nie ogłosiła. Dla kogoś, kto na nim polega, nie jest to problem: wagi leżą na Hugging Face, niezależni dostawcy nadal je serwują, a raz udzielona licencja Apache 2.0 obowiązuje niezależnie od tego, co pisze producent w swoim katalogu. wujec.ai ma już w katalogu wszystkie trzy te otwarte wydania.
Mixtral 8x22B →Pobierany flagowiec Alibaby to nie ten sam model, który firma wynajmuje — karta modelu wymienia cztery braki
Qwen3.8-Max, model o 2,446 biliona parametrów, którego wagi Alibaba opublikowała 8 sierpnia, jest pierwszym modelem klasy Max wydanym przez tę firmę do pobrania. Prawie żadne omówienie nie wspomina jednak, że plik do pobrania i model wołany przez API to nie ten sam produkt — a różnicę opisuje sama Alibaba, w nocie u góry karty modelu. Nota mówi, że wersja z API jest „oparta na" opublikowanym punkcie kontrolnym i ma „więcej funkcji, takich jak wejście obrazu i tryb bez rozumowania, milion tokenów kontekstu domyślnie, oficjalne narzędzia wbudowane". Czytana jako lista braków pobieranej wersji, daje cztery pozycje: - **Brak obrazu.** Repozytorium zawiera architekturę wyłącznie tekstową (`qwen3_5_moe_text`, znacznik `text-generation`). Hostowany Qwen3.8-Max przyjmuje zdjęcia i wideo; pobierany nie. - **Nie da się wyłączyć rozumowania.** Otwarty punkt kontrolny zawsze rozumuje przed odpowiedzią — głębokość reguluje `reasoning_effort`, ale tryb bez rozumowania istnieje tylko w API. - **262 144 tokenów, nie milion.** Karta podaje to wprost: 262 144 natywnie, z możliwością rozszerzenia do 1 010 000. Wersja hostowana ma milion domyślnie; kto uruchamia model u siebie, musi okno rozciągnąć sam i przyjąć konsekwencje dla jakości. - **Brak narzędzi wbudowanych.** Wyszukiwanie w sieci, uruchamianie kodu i reszta hostowanego zestawu należą do usługi, nie do wag. Nic z tego nie jest ukrywane — to jeden akapit we własnej karcie Alibaby, i właśnie dlatego warto go powtórzyć: krążące wyniki Qwen3.8-Max (Terminal-Bench 2.1 86,6, SWE-bench Pro 67,7, DeepSWE 1.1 56,6) zmierzono na konfiguracji hostowanej, a wdrożenie u siebie startuje z węższej. Karta rozstrzyga też, czym ten model jest architektonicznie — materiały premierowe mówiły o tym ogólnikami. To hybryda: 92 warstwy ułożone jako 23 powtórzenia trzech bloków Gated DeltaNet i jednego bloku uwagi bramkowanej, więc pełnej uwagi używa tylko co czwarta warstwa, a pozostałe korzystają z uwagi liniowej. W mieszance ekspertów jest ich 512, z czego na token uruchamia się 10 wybieranych i 1 wspólny. To ten układ sprawia, że 2,4 biliona parametrów kosztuje przy pracy 95 miliardów na token — i Qwen zastosował go po raz pierwszy w modelu flagowym. Nasz profil modelu ma już wpisane natywne okno kontekstu, architekturę hybrydową i wyraźną adnotację, że opublikowane wagi są wyłącznie tekstowe.
Qwen3.8-Max →Meta obiecała wagi flagowca tydzień temu — do pobrania wciąż jest tylko destylat
10 sierpnia 2026 roku Mark Zuckerberg opublikował obszerny esej, w którym przekonywał, że to amerykańskie ośrodki powinny przewodzić ruchowi otwartych wag, i zapowiedział, że Meta otworzy wagi Muse Spark 1.2 — swojego najmocniejszego modelu. Termin określił słowem "wkrótce". Daty nie podał. Siedem dni później firmowe konto Meta w serwisie Hugging Face zawiera cztery repozytoria i wszystkie cztery dotyczą tego samego, mniejszego modelu. Muse-Glimmer-30B z podstawowymi wagami pojawił się 9 sierpnia. Obok stoją: konwersja GGUF na potrzeby lokalnych środowisk, głowica pomocnicza do dekodowania spekulatywnego wydana jako repozytorium "assistant" oraz wersja ExecuTorch na urządzenia mobilne. Repozytorium Muse Spark nie ma w żadnej postaci — ani wydania 1.2, ani starszego 1.1 z lipca. Różnica waży więcej, niż się wydaje, bo te dwa modele nie są dla siebie zamiennikami. Meta opisuje Muse Glimmera jako destylację Muse Sparka: uczeń o około 29,6 mld parametrów, trenowany na odpowiedziach nauczyciela, z oknem kontekstu 131 072 tokenów wobec miliona u flagowca. To, co dziś można pobrać, jest skompresowaną pochodną modelu, którego wagi obiecano — nie samym modelem. Zainteresowanie pochodną okazało się przy tym spore. Cztery repozytoria Meta odnotowały 780 323 pobrania w ciągu ośmiu dni od publikacji: 334 099 dla podstawowych wag, 395 175 dla konwersji GGUF, 43 909 dla głowicy pomocniczej i 7 140 dla wersji mobilnej. Jedna społecznościowa kwantyzacja opublikowana przez Unsloth dokłada kolejne 755 125, co daje całej rodzinie ponad 1,5 mln pobrań w niewiele ponad tydzień. Wszystko na zwykłej licencji Apache 2.0, bez progów przychodu i liczby użytkowników — co samo w sobie jest odejściem od własnych licencji społecznościowych, którymi Meta obwarowywała wcześniejsze otwarte wydania. Dopóki wagi flagowca się nie pojawią, stan faktyczny pozostaje ten sam: Muse Spark 1.2 jest dostępny wyłącznie przez interfejsy Meta, a deklaracja otwartości pozostaje zapowiedzią, nie plikiem. wujec.ai zaktualizuje profil Muse Spark 1.2 w dniu, w którym repozytorium się pojawi.
Muse Spark 1.2 →Trzy miliardy pobrań Qwena obiegły świat — a raport, z którego pochodzą, mówi, że modele-giganty to 1% ruchu
Hugging Face opublikował 14 sierpnia 2026 swój półroczny przegląd modeli o otwartych wagach, a nazajutrz jedna liczba z niego obiegła świat: rodzina Qwen od Alibaby przekroczyła trzy miliardy pobrań, wyprzedzając Google i Metę razem wzięte. Ta liczba to własne, skumulowane wyliczenie Alibaby ze wszystkich platform. Pomiar samego raportu jest węższy i bardziej użyteczny: na samym Hugging Face repozytoria Qwena pobrano w 2026 roku 2045 mln razy, wobec 418 mln u Google i 227 mln u Mety. Qwen odpowiada dziś za ponad połowę wszystkich pobrań modeli otwartych w serwisie, a na jego bazie powstało 151 448 modeli pochodnych — od 180 do 210 nowych dziennie, przy 82 506 u Google i 32 155 u Llamy. Ustalenie, które nie przebiło się nigdzie, leży kilka wykresów dalej i podważa sposób, w jaki zwykle opisuje się ten wyścig. Modele poniżej miliarda parametrów odpowiadają za 83% wszystkich pobrań w historii serwisu. Modele powyżej 100 mld parametrów — czyli czołówka, ta od premier i tabel z wynikami testów — odpowiadają za 1%. Jeśli policzyć sam 2026 rok, wszystko powyżej 70 mld parametrów to wciąż tylko 3% ruchu. Rozkład jest bezlitosny także w drugą stronę: 85,6% modeli w serwisie ma w całym swoim życiu mniej niż 200 pobrań, a 1,5% zbiera 99,2% ruchu. Ta sama nierównowaga widać w tym, co ludzie faktycznie uruchamiają u siebie. W formacie GGUF, czyli skwantyzowanych plikach do lokalnego uruchamiania na zwykłym sprzęcie, Qwen pobierany jest 39,6 mln razy miesięcznie, Gemma od Google 20,8 mln, a Llama 7,5 mln — i to mimo że repozytoriów GGUF Llama ma opublikowanych więcej niż Qwen. Raport odczytuje to jako różnicę strategii, a nie wyrok o jakości: Qwen wydaje modele w każdej klasie wielkości, od takich poniżej miliarda parametrów, które chodzą na laptopie, po czołówkę — a laboratorium publikujące wyłącznie duże modele zbiera ułamek ruchu. Moonshot, którego otwarty dorobek to same modele czołowe, zanotował 37 mln pobrań, czyli 55 razy mniej niż Qwen. Dwa dalsze ustalenia warto odnotować każdemu, kto śledzi, kto co publikuje. Po pierwsze licencje: wśród chińskich wydań powyżej 20 mld parametrów 59% ma licencję Apache 2.0, a 22% MIT, i żadne nie ma zastrzeżenia niekomercyjnego — to tło dla rozdwojenia licencyjnego, które opisywaliśmy wczoraj przy Qwen3.8, gdzie mały model dostał Apache 2.0, a duży już nie. Po drugie autorstwo w najwyższej klasie: raport zauważa, że większość amerykańskich wydań powyżej 100 mld parametrów to pochodne chińskich modeli bazowych, a największą liczbę nowych repozytoriów publikują dziś producenci sprzętu — AMD i NVIDIA, po ponad 200 nowych repozytoriów każde — udostępniając warstwy optymalizacji i konwersji, a nie własne modele. Sam serwis urósł w tym czasie z 2,43 mln do 2,96 mln modeli.
Qwen 3 →Alibaba otwiera oba końce Qwen3.8 — ale tylko mały model dostaje Apache 2.0
Alibaba opublikowała już wagi obu połówek generacji Qwen3.8 — i dołączone do nich licencje to nie ten sam dokument. Qwen3.8-27B, wydany 14 sierpnia, to gęsty model wizyjno-językowy o 27,78 miliarda parametrów na zwykłej licencji Apache 2.0: bez progów, bez warunków, bez osobnej umowy na użytek komercyjny. Przyjmuje tekst, obrazy i wideo, ma natywne okno 262 144 tokenów, które według Alibaby rozciąga się do miliona, i działa na Transformers, vLLM, SGLang oraz TokenSpeed. Własna tabela producenta daje mu 61,7 na SWE-bench Pro wobec 57,6 dla zamkniętego Qwen3.7-Plus i 42,2 na DeepSWE 1.1 wobec 13,3 dla poprzedniej generacji 27B — to liczby producenta, nikt ich niezależnie nie powtórzył. Flagowiec wyszedł na innych warunkach. Qwen3.8-Max, 2,446 biliona parametrów, jest na Hugging Face jako Qwen3.8-2.4T-A95B w wersjach bf16 i FP8, ale na autorskiej „Licencji Qwen3.8-Max". Jej treść dla większości czytelników brzmi jak licencja swobodna: wolno używać, modyfikować, hostować, douczać i odsprzedawać. Zmieniają to dwa zapisy, ale dopiero przy dużej skali. Produkt mający ponad 100 milionów użytkowników miesięcznie albo 20 milionów dolarów przychodu miesięcznie musi wyraźnie pokazywać nazwę modelu w swoim interfejsie. A każda firma prowadząca działalność typu model jako usługa albo asystenta do kodowania i pracy biurowej, której przychód przekroczy 50 milionów dolarów w ciągu dwunastu miesięcy, musi przed użyciem komercyjnym uzyskać od Qwena osobną licencję — z wyłączeniem zastosowań wewnętrznych. W praktyce to licencja wycelowana w garstkę konkretnych konkurentów, zostawiająca wszystkich poniżej tych progów całkowicie wolnymi. Warto ten wzorzec obserwować: „otwarte wagi" po cichu stają się skalą odcieni, a różnica między dwoma plikami Qwen3.8 nie tkwi w kodzie, tylko w akapicie, który do niego dołączono. Oba modele są już w katalogu, a warunki licencji wypisaliśmy w całości w tabelach specyfikacji.
Qwen3.8-27B →DeepSeek wydaje finalne V4-Pro: otwarte wagi, milion tokenów kontekstu i skok w zadaniach agentowych
DeepSeek opublikował 13 sierpnia 2026 na Hugging Face model DeepSeek-V4-Pro-0813, opisując go jako oficjalne wydanie V4-Pro i następcę wag zapoznawczych, które nosiły tę nazwę od kwietnia. Repozytorium udostępniono na licencji MIT, więc cały model — 1,65 biliona parametrów w rzadkiej architekturze mixture-of-experts, 61 warstw, 384 ekspertów routowanych i sześciu aktywnych na token, w formacie FP8 — można pobrać i uruchomić u siebie. Okno kontekstu pozostaje na poziomie 1 048 576 tokenów. Architektura nie zmieniła się względem wersji zapoznawczej; nowością jest dołączony moduł spekulatywnego dekodowania DSpark oraz przebudowane sterowanie rozumowaniem. Parametr `reasoning_effort` przyjmuje teraz trzy poziomy — low, high i max — pozwalając wymieniać czas namysłu na koszt. DeepSeek zrezygnował też z szablonu rozmowy w formacie Jinja na rzecz udokumentowanego kodera w Pythonie, co oznacza pracę dla każdego, kto uruchamia wagi lokalnie. Poprawa, którą raportuje producent, skupia się w zadaniach agentowych i programistycznych — i jest duża. Według tabeli firmy nowa kompilacja osiąga 62,7% w DeepSWE wobec 12,8% dla wersji zapoznawczej, 61,5% w NL2Repo wobec 38,5%, 83,3% w Cybergym wobec 52,7% oraz 87,9 w Terminal Bench 2.1 wobec 72,1. W Humanity's Last Exam uzyskuje 42,7% bez narzędzi i 60,0% z narzędziami wobec wcześniejszych 37,7%. W zestawieniu z konkurencją obraz jest bardziej wyrównany. Kimi K3 wypada lepiej w Terminal Bench (88,3) i DeepSWE (67,5), a Fable 5 od Anthropica prowadzi w Humanity's Last Exam (53,3 bez narzędzi). DeepSeek utrzymuje jednak pozycję, którą zajmuje przez cały rok: wyniki porównywalne z czołówką, przy wagach udostępnionych, a nie wynajmowanych. Podane wyniki pochodzą od producenta i nie zostały jeszcze niezależnie powtórzone.
DeepSeek-V4-Pro →Model, którego Europa mieć nie mogła: Tencent zdejmuje wyłączenia terytorialne z Hy3 i wchodzi globalnie
Chińskie modele z otwartymi wagami przez ostatnie dwa lata ścigały się na rozmiar i cenę. Hy3 od Tencenta po cichu ścigał się o coś innego: o to, kto w ogóle może go pobrać. Gdy w kwietniu 2026 pojawiła się wersja zapoznawcza, jej licencja zawierała wyłączenie terytorialne — poza zasięgiem znalazły się Unia Europejska, Wielka Brytania i Korea Południowa. Oficjalne wydanie z 6 lipca 2026 usunęło ten zapis w całości i przeniosło wagi na czystą licencję Apache 2.0, jedne z najbardziej liberalnych warunków, jakie dotąd towarzyszyły modelowi tej skali. 5 sierpnia Tencent domknął sprawę, ogłaszając dostępność globalną: asystent WorkBuddy, narzędzie projektowe Miora i Tencent Cloud TokenHub, a poza tym dostęp przez OpenRouter i pliki do pobrania na Hugging Face oraz ModelScope. Sam model to rzadki mixture-of-experts: 295 miliardów parametrów łącznie, około 21 miliardów aktywowanych na token, 192 ekspertów z routingiem top-8, 80 warstw i osobny blok predykcji wielotokenowej o 3,8 miliarda parametrów, który przyspiesza generowanie. Okno kontekstu to 256 tysięcy tokenów. Cechą wyróżniającą jest to, że głębokość namysłu jest ustawieniem, a nie osobnym produktem — no_think odpowiada natychmiast, think_low rozumuje krótko, think_high prowadzi długi wywód — więc jeden endpoint obsługuje i zdawkową rozmowę, i wielogodzinne zadanie analityczne. Tencent przedstawia to tak, że Hy3 dorównuje flagowcom od dwóch do pięciu razy większym w rozumowaniu, wykonywaniu poleceń, uczeniu z kontekstu, generowaniu kodu i pracy agentowej. Firma podaje też, że w tydzień po premierze ruch API do Hy3 był 68 razy większy niż do poprzedniej generacji, co dało modelowi pierwsze miejsce w rankingu użycia OpenRoutera. Cennik na OpenRouterze to 0,1288 dolara za milion tokenów wejściowych i 0,5336 za milion wyjściowych; dostęp przez WorkBuddy jest bezpłatny do 31 sierpnia 2026. Najciekawsza jest ta liczba o użyciu. Deklaracje producentów o dorównywaniu konkurencji w testach są rutyną; 68-krotny skok płatnych wywołań API mówi natomiast, ilu programistów naprawdę się przesiadło. Niezależne omówienia zasadniczo potwierdzają deklarowane osiągi, wskazując kodowanie jako jedyny obszar, w którym konkurencyjne modele otwarte wciąż mają przewagę.
Tencent Hy3 →DeepMind otwiera model prognozujący cyklony: trzydniowe trasy tak dokładne jak wczorajsze dwudniowe
Google DeepMind opublikował w „Nature" model WeatherNext Cyclones i udostępnił jego wagi na GitHubie — razem z szerszym systemem WeatherNext 2. Główna deklaracja to cała doba wyprzedzenia: trzydniowe prognozy trasy i siły sztormu osiągają dziś dokładność, którą wcześniejsze modele uzyskiwały dopiero przy dwóch dniach. Model wytrenowano na około 20 terabajtach danych atmosferycznych i mniej więcej 5000 historycznych sztormów, a prognozuje zespołowo — DeepMind zwiększył przebieg z 50 do 1000 scenariuszy, co pozwala odczytywać rozrzut jako prawdopodobieństwo, a nie jako pojedynczą linię na mapie. Prognoza na 15 dni w rozdzielczości 28 na 28 kilometrów liczy się poniżej minuty na pojedynczym układzie TPU. Dla katalogu modeli AI to użyteczny punkt odniesienia, co obejmują dziś otwarte wagi. Prognozowanie pogody od kilku lat jest witryną wystawową uczenia maszynowego, ale systemy operacyjne stojące za prognozami państwowymi pozostawały zamknięte. Udostępnienie wag przenosi model tej klasy do służb meteorologicznych, których nie stać na wytrenowanie własnego. Dwa szczegóły dopełniają obraz. Pierwszy to pytanie, kto sprawdził tę pracę: DeepMind podaje, że model powstawał we współpracy z amerykańskim National Hurricane Center, instytutem CIRA i brytyjskim Met Office, i wskazuje sezon 2025 — gwałtowne wzmocnienie huraganu Melissa i jego wejście na ląd na Jamajce — jako przykład użycia operacyjnego. Drugi to intensywność, historycznie trudniejsza połowa zadania i ta, która przesądza o nakazach ewakuacji: model raportuje około 11 węzłów błędu, mniej niż wyspecjalizowany huraganowy HWRF, a błąd trasy na trzeci dzień wynosi około 100 km, lepiej niż zespół prognoz ECMWF. Kłopotliwe dla klasycznego podejścia jest to, że dzieje się to na siatce 28 na 28 kilometrów. Komórki są około sto razy rzadsze niż w modelach fizycznych, z którymi się go porównuje, a oko huraganu mieści się w jednej z nich. Model w ogóle nie odwzorowuje burzy — nauczył się, co zwykle robią dalej burze o danym kształcie i historii.
WeatherNext Cyclones →Otwarty „mózg" robotów NVIDII z licencją produkcyjną — GR00T N1.7 ogólnie dostępny
Linia otwartych modeli fundacyjnych GR00T od NVIDII po cichu przekroczyła próg, który dla każdego, kto chce zbudować na niej produkt, znaczy najwięcej. Gdy 17 kwietnia 2026 roku ogłoszono wczesny dostęp do N1.7, najważniejszą nowością nie był wynik w teście, tylko zapis licencyjny: wydanie wychodzi — cytując NVIDIĘ — z „licencją, która dopuszcza zastosowania produkcyjne". Wcześniejsze wersje modelu rozprowadzano na niekomercyjnej licencji NVIDII. Repozytorium Isaac-GR00T opisuje dziś N1.7 jako ogólnie dostępną, ze wsparciem i gwarancją stabilności; NVIDIA nie podała daty tego kroku, więc ogólną dostępność podajemy jako stan repozytorium, a nie jako zdarzenie z datą. Pod zmianą licencji kryje się realna zmiana architektury. Rdzeniem wizyjno-językowym jest teraz Cosmos-Reason2-2B zbudowany na architekturze Qwen3-VL, w miejsce rdzenia Eagle z wersji N1.6 — własny model rozumujący NVIDII trafił do wnętrza własnej polityki robotycznej NVIDII. Głowica czynnościowa pozostaje transformerem dyfuzyjnym z dopasowaniem przepływu, ale jej głębokość odwraca poprzednie wydanie: N1.6 podwoiła ją z 16 do 32 warstw, a N1.7 wraca do 16. Nowe są dwie zdolności: ustrukturyzowane rozumowanie na poziomie zadania i podzadania oraz sterowanie na poziomie palców, pomyślane pod pracę z bogatym kontaktem, na przykład montaż drobnych części. Karta modelu jest wyjątkowo szczera co do kosztów. Pretrening objął 21,6 mln punktów danych z 13 zbiorów, a NVIDIA publikuje, ile ten przebieg pochłonął: 41 288 kWh i 16,949 tony ekwiwalentu CO2. Równie konkretne są liczby wdrożeniowe — i pokazują cenę przeniesienia polityki na samego robota. Z TensorRT na H100 krok trwa 27,9 ms, czyli 35,9 Hz. Na Jetsonie Orin skompilować da się wyłącznie transformer dyfuzyjny, bo TensorRT 10.3 nie obsługuje silnika rdzenia, i ten sam krok zajmuje 216,5 ms, czyli 4,6 Hz. Warto odnotować jedną niespójność, bo obie wypowiedzi pochodzą od NVIDII: strona badawcza opisywała N1.6 jako korzystającą z wewnętrznego wariantu Cosmos-2B, a repozytorium N1.7 podaje, że N1.6 używała rdzenia Eagle. Zapisujemy obie i nie rozstrzygamy. Starsze wersje nie zostały wycofane — N1.6 i N1.5 pozostają dostępne w gałęziach n1d6 i n1d5. GR00T N1.7 ma od dziś własny profil w tym katalogu, obok pierwotnej wersji N1 z marca 2025 roku. Materiał ukazuje się bez ilustracji. Logo NVIDII nie jest zwykłym napisem, a nie udało nam się ustalić licencji pozwalającej na użycie bez atrybucji, której nasze ilustracje newsowe obecnie wymagają.
NVIDIA Isaac GR00T N1.7 →NVIDIA oddaje model do jazdy: Alpamayo 2 Super z licencją pozwalającą sprzedawać to, co na nim zbudujesz
NVIDIA udostępniła Alpamayo 2 Super — model fundamentowy typu wizja-język-działanie dla pojazdów autonomicznych — na licencji OpenMDW-1.1 Linux Foundation, która pozwala na dostrajanie, tworzenie modeli pochodnych i komercyjną redystrybucję. W kategorii, w której stos do jazdy autonomicznej bywa najpilniej strzeżonym zasobem firmy, sama licencja jest newsem w nie mniejszym stopniu niż model. Model łączy Cosmos 3 Super Reasoner o 32 miliardach parametrów z dyfuzyjnym ekspertem od działań o 2 miliardach — razem 34 miliardy według opublikowanej karty modelu. Nie zwraca wyłącznie trajektorii: podaje też ślad łańcucha przyczynowego wyjaśniający wybór tej trajektorii, meta-akcję, automatyczne etykiety oraz ugruntowane odpowiedzi na pytania o obraz. W teście rozumienia sytuacji drogowych LingoQA NVIDIA raportuje pierwsze miejsce wśród około czterdziestu modeli — o 17,0 punktu przed Qwen2.5-VL 72B i o 15,1 przed Gemini 2.5 Pro. Jedno zastrzeżenie dla porównujących liczby: wpis na blogu NVIDII zaokrągla model do „30 miliardów" parametrów, podczas gdy karta modelu i repozytorium podają 34 miliardy (32 mld plus 2 mld). Podajemy wartość z karty modelu.
Mistral otwiera trzymiliardowego moderatora, który czyta regulamin w trakcie pracy, a nie na treningu
Mistral AI wydał 4 sierpnia 2026 model Shieldstral 1.0 — trzymiliardowy klasyfikator bezpieczeństwa na licencji Apache 2.0. To pierwszy model moderacyjny, który firma udostępniła z otwartymi wagami; wcześniej miała w ofercie dwa takie modele wyłącznie jako usługę. Najciekawsze jest rozwiązanie konstrukcyjne. Modele-strażnicy zwykle mają wbudowaną listę kategorii szkód ustaloną podczas treningu, więc platforma o innych zasadach — albo taka, która zasady zmienia — zostaje z wyborem między trenowaniem od nowa a filtrowaniem nie tego, co trzeba. Shieldstral zamienia moderację w jedno pytanie tak/nie zadawane w momencie użycia: programista podaje kontekst, regułę zapisaną zwykłym językiem i treść do oceny, a model zwraca wyłącznie prawdopodobieństwa odpowiedzi „tak" i „nie", z których powstaje ciągła ocena ryzyka. Zmiana polityki to zmiana promptu. Podawane wyniki zestawiają mały model z dużo większymi. Mistral raportuje 88,1 F1 na WildGuardTest, 84,1 na ToxicChat i 99,4 na klasyfikacji promptów w HarmBench, a do tego 97,7 na multimodalnym zbiorze VLGuard — czyli tyle samo lub więcej niż otwarci strażnicy nawet siedmiokrotnie więksi, według testów samego producenta. Model obsługuje dwanaście języków, ocenia obrazy tak samo jak tekst i był trenowany na kontekście 32 tys. tokenów. Liczbą, która przesądza o zastosowaniach, jest 16 GB. Tyle wystarczy — jedna karta ze środka półki, a po kwantyzacji w llama.cpp nawet procesor. Warstwa moderacji mieszcząca się na jednej maszynie staje się dostępna dla tych, którzy prawnie lub handlowo nie mogą wysyłać treści użytkowników do cudzego API: szpitali, administracji, każdego objętego twardymi wymogami miejsca przetwarzania danych. Dla Mistrala to zarazem dokładnie ten argument, na który czekali europejscy klienci. Jedno ograniczenie trzeba powiedzieć wprost: wszystkie powyższe wyniki pochodzą od firmy, która model zbudowała, a modele-strażnicy są wyjątkowo czułe na sformułowanie reguły. Wagi są jawne, więc niezależne pomiary powinny się pojawić.
Shieldstral 1.0 3B →Alibaba wypuszcza Qwen3.8-Max — flagowy model o 2,4 biliona parametrów
Alibaba udostępniła 3 sierpnia 2026 model Qwen3.8-Max — największy, jaki dotąd powstał w rodzinie Qwen. To rzadka architektura mixture-of-experts: 2,4 biliona parametrów łącznie, z czego na token aktywowanych jest około 95 miliardów, przy oknie kontekstu sięgającym miliona tokenów. Model jest dostępny globalnie przez API Alibaba Cloud Model Studio oraz w QwenWork, firmowej platformie agentów do pracy biurowej. Alibaba zapowiedziała publiczne udostępnienie pełnych wag modelu, a obok nich mniejszy wariant Qwen3.8-27B, przeznaczony na wdrożenia o ograniczonych zasobach sprzętowych. W rankingu Arena.AI Qwen3.8-Max został najwyżej ocenianym chińskim modelem w zadaniach tekstowych i zajął drugie miejsce na świecie w zadaniach wizyjnych, co stawia go w jednej klasie z czołowymi systemami OpenAI i Anthropic. Po ogłoszeniu akcje Alibaby wyraźnie zwyżkowały w Hongkongu.
Qwen3.8-Max →Miliardowy łowca błędów od Cisco: Antares lokalizuje podatności, a kod nie opuszcza firmy
Grupa Foundation AI w Cisco udostępniła Antares-350M i Antares-1B — dwa małe modele językowe o otwartych wagach, zbudowane pod jedno zadanie z obszaru bezpieczeństwa, i opublikowała je na Hugging Face. Zadanie to lokalizacja podatności: mając bazę kodu i opis znanej luki, wskazać pliki, które faktycznie ją zawierają. Brzmi wąsko i o to właśnie chodzi. Zespoły bezpieczeństwa segregujące napływające zgłoszenia spędzają większość czasu na odpowiadaniu dokładnie na to pytanie w repozytoriach, których same nie pisały, a modele czołowe są do tego narzędziem kosztownym. Antares robi to inaczej niż skanery: zamiast sprawdzać kod według sztywnych reguł, prowadzi śledztwo tak jak człowiek — wychodzi od opisu podatności, szuka pasujących wzorców w kodzie, czyta kandydujące pliki, włącza nowe przesłanki z powrotem do wyszukiwania i porzuca tropy, które donikąd nie prowadzą. Teza Cisco brzmi: model uformowany wokół takiej pętli nie musi być duży. Porównania, które firma publikuje, są wymowne. Antares-1B ma w tym zadaniu wypadać lepiej niż Gemini 3 Pro od Google i być na równi z GLM-5.2 od Z.ai — modelem o 744 miliardach parametrów. Cisco zapowiada też nieudostępniony jeszcze Antares-3B, który według firmy bije zarówno GLM-5.2, jak i GPT-5.5 od OpenAI. W wydajności różnica jest jeszcze ostrzejsza: 500 repozytoriów przeskanowanych w 15 minut wobec około pięciu godzin u modeli czołowych, przy koszcie, który Cisco szacuje na mniej więcej 172 razy niższy niż w przypadku GPT-5.5. Argument wdrożeniowy może tu ważyć więcej niż benchmarkowy. Model, który mieści się na laptopie, działa wewnątrz firmowego perymetru — a to znaczy, że zastrzeżony kod źródłowy nigdy nie trafia do analizy przez zewnętrzne API. Właśnie ta obawa trzymała wiele zespołów bezpieczeństwa z dala od segregacji zgłoszeń wspieranej modelami językowymi. Otwarte wagi sprawiają, że da się to sprawdzić, a nie tylko obiecać. Oczywiste zastrzeżenie brzmi: to dane producenta, na zadaniu wybranym przez producenta, a niezależnych powtórzeń jeszcze nie ma. Kierunek jest jednak wart uwagi — mały model zbudowany pod konkretną robotę, wygrywający z uniwersalnymi gigantami, zapowiada przyszłość znacznie tańszą niż ta, w której każdy proces bezpieczeństwa woła API modelu czołowego.
Antares-1B →Flagowy model DeepSeeka o 1,6 biliona parametrów wchodzi do pełnej dostępności — i zaczyna liczyć według zegara
DeepSeek-V4-Pro wyszedł z fazy zapoznawczej 19 lipca 2026, trzy miesiące po pierwszej publicznej premierze. Wagi są tymi samymi, które opublikowano 24 kwietnia: rzadki model mixture-of-experts o 1,6 biliona parametrów, z czego około 49 miliardów aktywnych na token, okno kontekstu miliona tokenów i licencja MIT pozwalająca każdemu pobrać model i uruchomić go u siebie. Pełna dostępność zmieniła stronę handlową. DeepSeek po raz pierwszy wprowadził taryfę szczytową, podwajającą stawki w godzinach pracy w Pekinie; poza szczytem API kosztuje 0,435 dolara za milion tokenów wejściowych i 0,87 za milion wyjściowych. Wejście z pamięci podręcznej rozliczane jest po około setnej części stawki pozaszczytowej. 24 lipca firma wycofała stare punkty końcowe deepseek-chat i deepseek-reasoner, więc integracje muszą teraz wskazywać model wprost. Według danych opublikowanych przez DeepSeeka przy premierze GA model uzyskuje 80,6% w SWE-bench Verified — najlepszy opublikowany wynik modelu z otwartymi wagami — przy ratingu 3206 w Codeforces, 57,9% w SimpleQA Verified i 37,7% w Humanity's Last Exam. Pomiar niezależny opowiada rzecz subtelniejszą: Artificial Analysis ocenił V4-Pro na 44 punkty w Intelligence Index w momencie GA wobec 52 przy premierze zapoznawczej. Model się nie pogorszył — przez te trzy miesiące przesunęła się stawka. Mniejszy DeepSeek-V4-Flash i wcześniejszy DeepSeek-R1 pozostają dostępne, a wszystkie trzy mają już profile w katalogu wujec.ai.
DeepSeek-V4-Pro →