Newsy
Co słychać w robotyce i AI — wybór redakcji wujec.ai.
Najczęściej pobierany model MiniMaxa jest jedynym, na którym nie wolno nic zarobić
MiniMax M2.7 pobierany jest z Hugging Face około 909 tysięcy razy miesięcznie — częściej niż jakikolwiek inny model tekstowy tego chińskiego laboratorium i ponad czterokrotnie częściej niż jego własny następca M3. Jest też jedynym w rodzinie, który zakazuje użytku komercyjnego. Plik licencji dołączony do wag nosi tytuł „Non-Commercial License”. Użytek osobisty, uruchamianie na własnym sprzęcie, badania i eksperymenty są wprost darmowe. Cała reszta nie: sprzedaż produktu lub usługi opartej na modelu, wystawienie go za płatnym API czy wdrożenie dotrenowanej odmiany w celach zarobkowych wymagają wcześniejszej pisemnej zgody MiniMaxa, o którą występuje się mailowo. Kto taką zgodę otrzyma, musi dodatkowo umieścić w produkcie widoczny napis „Built with MiniMax M2.7”. Ten warunek jest wyjątkiem, a nie kierunkiem. MiniMax M2 (październik 2025) i M2.1 (grudzień 2025) wyszły na licencji MIT z jednym dopiskiem: komercyjny produkt oparty na modelu musi pokazywać w interfejsie nazwę modelu. W M2 obowiązek zaczyna się dopiero powyżej 100 mln aktywnych użytkowników miesięcznie albo 30 mln USD rocznych przychodów powtarzalnych; w M2.1 nie ma żadnego progu. M2.5 (luty 2026) przeszedł na własną licencję modelową producenta, która nadal pozwala na rozpowszechnianie, ale wymaga, by z każdą kopią wędrowała ustalona nota atrybucyjna. M2.7, wydany miesiąc później, zamknął użytek komercyjny całkowicie. M3 z czerwca 2026 znów go otworzył — na licencji społecznościowej dopuszczającej wdrożenia zarobkowe w zamian za widoczną atrybucję. Skutek praktyczny łatwo przeoczyć, bo strona pobierania niczym go nie sygnalizuje. Cztery modele tej linii dzielą ten sam korpus — 62 warstwy, 256 ekspertów, ośmiu aktywnych na token, a M2, M2.1 i M2.7 mają co do bajta 228 689 764 864 parametrów. Zespół, który podmienia jeden na drugi jako zwykłą aktualizację, zmienia swoją sytuację prawną, nie zmieniając ani linijki kodu. Najmocniejszym modelem tej linii do swobodnego użytku pozostaje M2.5; najmocniejszym w ogóle, według tabeli benchmarków samego producenta, jest ten, który wymaga podpisu. wujec.ai dodał dziś do katalogu profile M2.1, M2.5 i M2.7, w każdym opisując warunki licencji.
MiniMax M2.7 →Meta obiecała wagi flagowca tydzień temu — do pobrania wciąż jest tylko destylat
10 sierpnia 2026 roku Mark Zuckerberg opublikował obszerny esej, w którym przekonywał, że to amerykańskie ośrodki powinny przewodzić ruchowi otwartych wag, i zapowiedział, że Meta otworzy wagi Muse Spark 1.2 — swojego najmocniejszego modelu. Termin określił słowem "wkrótce". Daty nie podał. Siedem dni później firmowe konto Meta w serwisie Hugging Face zawiera cztery repozytoria i wszystkie cztery dotyczą tego samego, mniejszego modelu. Muse-Glimmer-30B z podstawowymi wagami pojawił się 9 sierpnia. Obok stoją: konwersja GGUF na potrzeby lokalnych środowisk, głowica pomocnicza do dekodowania spekulatywnego wydana jako repozytorium "assistant" oraz wersja ExecuTorch na urządzenia mobilne. Repozytorium Muse Spark nie ma w żadnej postaci — ani wydania 1.2, ani starszego 1.1 z lipca. Różnica waży więcej, niż się wydaje, bo te dwa modele nie są dla siebie zamiennikami. Meta opisuje Muse Glimmera jako destylację Muse Sparka: uczeń o około 29,6 mld parametrów, trenowany na odpowiedziach nauczyciela, z oknem kontekstu 131 072 tokenów wobec miliona u flagowca. To, co dziś można pobrać, jest skompresowaną pochodną modelu, którego wagi obiecano — nie samym modelem. Zainteresowanie pochodną okazało się przy tym spore. Cztery repozytoria Meta odnotowały 780 323 pobrania w ciągu ośmiu dni od publikacji: 334 099 dla podstawowych wag, 395 175 dla konwersji GGUF, 43 909 dla głowicy pomocniczej i 7 140 dla wersji mobilnej. Jedna społecznościowa kwantyzacja opublikowana przez Unsloth dokłada kolejne 755 125, co daje całej rodzinie ponad 1,5 mln pobrań w niewiele ponad tydzień. Wszystko na zwykłej licencji Apache 2.0, bez progów przychodu i liczby użytkowników — co samo w sobie jest odejściem od własnych licencji społecznościowych, którymi Meta obwarowywała wcześniejsze otwarte wydania. Dopóki wagi flagowca się nie pojawią, stan faktyczny pozostaje ten sam: Muse Spark 1.2 jest dostępny wyłącznie przez interfejsy Meta, a deklaracja otwartości pozostaje zapowiedzią, nie plikiem. wujec.ai zaktualizuje profil Muse Spark 1.2 w dniu, w którym repozytorium się pojawi.
Muse Spark 1.2 →Model przejrzał 269 projektów open source i znalazł 2436 błędów — najstarszy z 1981 roku
Z.ai wydał GLM-5.3 14 sierpnia i najciekawszą liczbę schował głęboko w komunikacie. Współpracując z zespołami bezpieczeństwa w Chinach, firma skierowała model na realne repozytoria otwartego oprogramowania. Po weryfikacji ekspertów, przesianiu i usunięciu powtórzeń model wskazał **2436 podatności w 269 projektach** — 107 oznaczonych jako krytyczne, 990 jako wysokie, 1286 jako średnie i 53 jako niskie. Znaleziska obejmują jądra systemów, systemy operacyjne, silniki przeglądarek, biblioteki infrastrukturalne, aplikacje webowe i protokoły sieciowe. Uderzająca jest nie liczba, tylko wiek. Według danych Z.ai przeciętna wada tkwiła w kodzie **26,6 roku**, zanim ktokolwiek ją zauważył, a najstarsza została wprowadzona w **1981 roku** — czterdzieści pięć lat oddziaływania. To nie są świeże regresje w szybko zmieniających się projektach; to defekty, które przetrwały wszystkie ludzkie przeglądy kodu, analizatory statyczne i kampanie fuzzingu ostatnich czterech dekad. Z.ai twierdzi, że ta zdolność nie była celem. Środowiska wyszukiwania podatności dodano do dotrenowania, licząc na to, że model lepiej wychwyci pojedyncze błędy; wyszedł z tego — słowami firmy — model rozumujący o wielu etapach ataku i układający spójne plany całych łańcuchów. Wyniki testów potwierdzają jednak twierdzenie węższe: na CyberGym, który startuje od kodu źródłowego i sprawdza, czy model potrafi znaleźć i potwierdzić podatność, GLM-5.3 uzyskuje 84,5% wobec 77,2% poprzednika, minimalnie przed Claude Mythos 5 (83,8%) i GPT-5.6 Sol (83,6%). Dalej w łańcuchu przewaga znika — na ExploitBench osiąga 54,4% wobec 78,0% Mythos 5, a na ExploitGym wykonuje 105 zadań w dwie godziny wobec 181. Z.ai pisze to wprost: przewaga leży na początku łańcucha, a dystans do zamkniętej czołówki jest największy tam, gdzie zdolność waży najwięcej. Nietypowe jest to, że ujawnieniu towarzyszy udokumentowany ślad. Z.ai opublikował publiczny rejestr pod adresem cvd.z.ai, w którym każde znalezisko jest odnotowane wraz z przebiegiem skoordynowanego ujawniania: projekt, poziom krytyczności, numer CVE jeśli przyznano oraz to, jak długo wada siedziała w kodzie. W dniu ogłoszenia **53 znaleziska były jawne, a 2383 pozostawały pod embargiem** — i to jest właściwa historia. Jeden przebieg modelu wytworzył zaległość nieujawnionych podatności większą niż roczny wolumen niejednego krajowego zespołu CERT, a harmonogram trzymają teraz opiekunowie tych 269 projektów. GLM-5.3 nie był w dniu premiery do pobrania. Z.ai zapowiedział wagi na około dwa tygodnie po ogłoszeniu, a API oznaczył jako wkrótce; na razie model działa przez abonament GLM Coding Plan i agenta ZCode. Kiedy wagi się pojawią, ta sama zdolność, która zapełniła rejestr, stanie się dostępna dla każdego, kto ma sprzęt do jej uruchomienia — co jest argumentem za wydawaniem etapowym i argumentem przeciwko niemu, zależnie od tego, kto go używa. *Nota redakcyjna: wujec.ai opisuje zdolności bezpieczeństwa jako opublikowaną właściwość tych modeli. Nie przytaczamy materiału umożliwiającego atak i odsyłamy wyłącznie do prowadzonego przez producenta rejestru skoordynowanego ujawniania.*
GLM-5.3 →Podwyżka o połowę odwołana: 2 i 10 dolarów za Claude Sonnet 5 zostaje ceną standardową
Na szesnaście dni przed terminem Anthropic odwołał podwyżkę, którą zaplanował dla Claude Sonnet 5. W dokumentacji cenowej firmy stoi teraz wprost, że stawka 2 USD za milion tokenów wejścia i 10 USD za milion tokenów wyjścia — ogłoszona przy premierze jako cena wprowadzająca obowiązująca do 31 sierpnia 2026 roku — jest ceną standardową, a zapowiedziana na 1 września podwyżka do 3 i 15 USD nie wejdzie w życie. To odwrócenie stanu, o którym pisaliśmy 6 sierpnia, gdy ta sama dokumentacja niosła datę wygaśnięcia w przypisie. Rabat z odliczaniem stał się po prostu ceną. Sonnet 5 zachowuje swoje miejsce w drabinie Anthropic — Fable 5 kosztuje 10 / 50 USD, Opus 5 — 5 / 25 USD, Sonnet 5 — 2 / 10 USD, a Haiku 4.5 — 1 / 5 USD — ale przestał być jedynym aktualnym modelem Claude sprzedawanym poniżej własnego cennika. Jedno zastrzeżenie z tamtego tekstu pozostaje w mocy, bo nigdy nie dotyczyło cennika. Sonnet 5 korzysta z tokenizera wprowadzonego wraz z Opus 4.7, a według własnej noty Anthropic ten sam tekst daje na nim mniej więcej o 30% więcej tokenów niż na poprzedniej generacji; Sonnet 4.6 i starsze modele używają tokenizera starszego. Na papierze Sonnet 5 jest o jedną trzecią tańszy od Sonneta 4.6 z ceną 3 / 15 USD. Liczony za stronę tekstu, a nie za token, oszczędza bliżej jednej dziesiątej. Ta sama arytmetyka dotyczy okna kontekstu: milion tokenów na Sonnecie 5 firma wycenia na około 555 tysięcy słów, podczas gdy ten sam milion na Sonnecie 4.6 mieścił mniej więcej 750 tysięcy słów. Moment nasuwa jedno porównanie. Dwa dni temu Google pokazało Gemini 3.7 Flash w cenie 0,75 i 3,75 USD za milion tokenów, reklamowanej jako połowa ceny poprzednika — a we własnym cenniku opatrzonej datą 31 grudnia 2026 roku, po której stawka się podwaja. W ciągu jednego tygodnia dwaj dostawcy podjęli więc odwrotne decyzje w tej samej sprawie: jeden zdjął z obniżki datę ważności, drugi ją zostawił. Dla kogoś, kto planuje budżet na rok do przodu, ta różnica waży więcej niż same liczby na czele komunikatów. Profil Claude Sonnet 5 w naszym katalogu ma już wpisaną cenę standardową i odwołaną podwyżkę.
Claude Sonnet 5 →DeepSeek wydaje finalne V4-Pro: otwarte wagi, milion tokenów kontekstu i skok w zadaniach agentowych
DeepSeek opublikował 13 sierpnia 2026 na Hugging Face model DeepSeek-V4-Pro-0813, opisując go jako oficjalne wydanie V4-Pro i następcę wag zapoznawczych, które nosiły tę nazwę od kwietnia. Repozytorium udostępniono na licencji MIT, więc cały model — 1,65 biliona parametrów w rzadkiej architekturze mixture-of-experts, 61 warstw, 384 ekspertów routowanych i sześciu aktywnych na token, w formacie FP8 — można pobrać i uruchomić u siebie. Okno kontekstu pozostaje na poziomie 1 048 576 tokenów. Architektura nie zmieniła się względem wersji zapoznawczej; nowością jest dołączony moduł spekulatywnego dekodowania DSpark oraz przebudowane sterowanie rozumowaniem. Parametr `reasoning_effort` przyjmuje teraz trzy poziomy — low, high i max — pozwalając wymieniać czas namysłu na koszt. DeepSeek zrezygnował też z szablonu rozmowy w formacie Jinja na rzecz udokumentowanego kodera w Pythonie, co oznacza pracę dla każdego, kto uruchamia wagi lokalnie. Poprawa, którą raportuje producent, skupia się w zadaniach agentowych i programistycznych — i jest duża. Według tabeli firmy nowa kompilacja osiąga 62,7% w DeepSWE wobec 12,8% dla wersji zapoznawczej, 61,5% w NL2Repo wobec 38,5%, 83,3% w Cybergym wobec 52,7% oraz 87,9 w Terminal Bench 2.1 wobec 72,1. W Humanity's Last Exam uzyskuje 42,7% bez narzędzi i 60,0% z narzędziami wobec wcześniejszych 37,7%. W zestawieniu z konkurencją obraz jest bardziej wyrównany. Kimi K3 wypada lepiej w Terminal Bench (88,3) i DeepSWE (67,5), a Fable 5 od Anthropica prowadzi w Humanity's Last Exam (53,3 bez narzędzi). DeepSeek utrzymuje jednak pozycję, którą zajmuje przez cały rok: wyniki porównywalne z czołówką, przy wagach udostępnionych, a nie wynajmowanych. Podane wyniki pochodzą od producenta i nie zostały jeszcze niezależnie powtórzone.
DeepSeek-V4-Pro →OpenAI wypuszcza model wytrenowany, by przestał odmawiać: GPT-5.6 Cyber odpowiada na 95% pytań o włamania — i prawie nikt go nie kupi
OpenAI ogłosiła GPT-5.6 Cyber 10 sierpnia 2026 roku, a liczba postawiona na pierwszym miejscu jest nietypowa: to nie wynik sprawności, lecz odsetek udzielonych odpowiedzi. We własnej mierze firmy — Advanced Cybersecurity Completion Rate, czyli jak często model odpowiada na pytania o łańcuchy exploitów, obejście uwierzytelniania i eskalację uprawnień, zamiast odmówić — nowy model odpowiada na 95,0% z nich. GPT-5.6 Sol za standardowymi zabezpieczeniami odpowiada na 1,5%. Zeszłoroczny GPT-5.5 Cyber osiągał 57,3%. Model zbudowano na GPT-5.6 Sol i dotrenowano do wyszukiwania podatności zero-day oraz budowy exploitów. Jego przydatność pokazano już na działającym oprogramowaniu: OpenAI zbadała nim V8, silnik JavaScriptu w Chrome, i znalazła dwa nieznane wcześniej błędy, które razem pozwalają wyjść z piaskownicy sterty. Google naprawił je jako CVE-2026-15903. Firma raportuje też co najmniej pięć podatności w powszechnie używanym systemie mobilnym, trzy krytyczne błędy w popularnej bazie danych i ponad 400 możliwości eskalacji uprawnień w jądrze systemu — wszystko w trybie skoordynowanego ujawniania. O wadze premiery nie decyduje jednak sama sprawność, bo miejscami jest ona niższa. W trudniejszym ExploitBench 3, gdzie zabezpieczenia piaskownicy V8 pozostają włączone, zwykły GPT-5.6 Sol rozwiązuje więcej w standardowym limicie 300 tur; różnica zaciera się dopiero przy 600. W wewnętrznej ocenie raportów o podatnościach Cyber wypada gorzej od Sola, co firma tłumaczy krótszymi i uboższymi opisami. W ramach Preparedness Framework model dostał ocenę High dla zdolności cybernetycznych — taką samą jak Sol — i poniżej progu Critical. Zmieniło się to, kto może pytać. GPT-5.6 Cyber istnieje wyłącznie w Daybreak Red, ofensywnym poziomie programu dostępu, który OpenAI rozszerzyła tego samego dnia; defensywny Daybreak Blue zostawia modele ogólnego przeznaczenia z zabezpieczeniami nastawionymi na obronę. Wejście wymaga weryfikacji tożsamości, ograniczeń dozwolonych zastosowań, monitoringu i oświadczeń prawnych, a od 1 września 2026 każde konto indywidualne w Daybreak musi używać sprzętowego klucza bezpieczeństwa. Wśród wymienionych wcześniejszych partnerów są Accenture, IBM, Capgemini, EY, KPMG, PwC, Palo Alto Networks, CrowdStrike, Cloudflare, Akamai, Fortinet, Sophos i SpecterOps. Technicznie model jest węższy od Sola: okno kontekstu 400 000 tokenów wobec 1 050 000, wyjście do 128 000 tokenów, na wejściu tekst i obraz, na wyjściu tekst, wiedza do 16 lutego 2026. Działa tylko na endpoincie Responses — bez chat completions, trybu wsadowego i dostrajania — a cennik to 12,50 USD za milion tokenów wejścia i 75 USD za milion wyjścia, dwa i pół raza więcej niż u Sola. Pełną kartę systemową firma zapowiedziała na później.
GPT-5.6 Cyber →Cena wprowadzająca Claude Sonnet 5 wygasa 31 sierpnia — rachunek rośnie o połowę
**Aktualizacja 15 sierpnia 2026:** Anthropic odwołał tę podwyżkę. Dokumentacja cenowa nazywa dziś stawkę 2 / 10 USD ceną standardową Claude Sonnet 5 i stwierdza, że podwyżka do 3 / 15 USD 1 września nie wejdzie w życie. Zob. Podwyżka o połowę odwołana (/news/claude-sonnet-5-price-rise-cancelled-2-10-permanent). Akapit o tokenizerze poniżej pozostaje aktualny. W dokumentacji modeli Anthropic stoi przypis, który łatwo przeoczyć, a drogo zignorować: cena wprowadzająca 2 USD za milion tokenów wejścia i 10 USD za milion tokenów wyjścia obowiązuje dla Claude Sonnet 5 tylko do 31 sierpnia 2026 roku. Od 1 września model wraca do cennika katalogowego 3 i 15 USD — czyli po obu stronach licznika drożeje o połowę, i to za niecałe cztery tygodnie. Sonnet 5 nie jest dla Anthropic produktem marginalnym. Wydany 30 czerwca 2026 roku, jest domyślnym modelem planów free i Pro oraz — jak deklaruje sama firma — najlepszym połączeniem szybkości i inteligencji, z natywnym oknem kontekstu miliona tokenów, 128 000 tokenów wyjścia w Messages API i wynikiem 63,2% w SWE-Bench Pro. Jest też na dziś jedynym aktualnym modelem Claude sprzedawanym poniżej własnego cennika: Fable 5 kosztuje 10 / 50 USD, Opus 5 — 5 / 25 USD, a Haiku 4.5 — 1 / 5 USD, wszystkie w cenach katalogowych. W tę samą stronę działa jeszcze jeden, cichszy mechanizm, który z cennikiem nie ma nic wspólnego. Własna dokumentacja Anthropic wycenia milionowe okno kontekstu modeli Fable 5, Opus 5 i Sonnet 5 na około 555 tysięcy słów, podczas gdy ten sam milion tokenów na Opus 4.6 i Sonnet 4.6 mieścił około 750 tysięcy słów. Przy Fable 5 firma nazywa przyczynę wprost: model korzysta z tokenizera wprowadzonego wraz z Opus 4.7, a ten sam tekst daje na nim mniej więcej o 30% więcej tokenów niż na starszych modelach. Ponieważ jednostką rozliczeniową jest właśnie token, niezmieniona praca przeniesiona na nowszą generację jest liczona wyżej, zanim jeszcze zadziała jakakolwiek zmiana stawki. Czym to natomiast nie wygląda na przecenę całej oferty. Anthropic nie zapowiedział zmiany stawek żadnego innego modelu, a próg wycofania Sonneta 5 pozostaje nieruszony na 30 czerwca 2027 roku. Najprostszy odczyt jest taki, że rabat premierowy po prostu wygasa zgodnie z planem. Dla każdego, kto planuje budżet na Sonnecie 5, liczą się dwie daty: 31 sierpnia, gdy kończy się rabat, oraz moment przeniesienia pracy z modelu generacji 4.6, gdy zmienia się sama liczba tokenów. W naszym profilu Claude Sonnet 5 stoi już i cena wprowadzająca, i katalogowa.
Claude Sonnet 5 →Własny model Perplexity schodzi na bok: API Sonara staje się sklepem z modelami OpenAI, Anthropic i Google
Dokumentacja deweloperska Perplexity zaczyna się dziś zdaniem, które brzmi jak cicha zmiana modelu biznesowego: „Sonar Chat Completions to teraz Agent API". Interfejs, który firma uruchomiła 21 stycznia 2025, żeby sprzedawać własny model osadzony w wyszukiwaniu, ustępuje miejsca interfejsowi zbudowanemu wokół pętli agentowej — i wokół modeli innych firm. Agent API opisywane jest jako jednolity interfejs do aplikacji agentowych, z wbudowanymi narzędziami, których stary endpoint nie miał: wyszukiwaniem w sieci, pobieraniem stron, piaskownicą kodu, serwerami MCP oraz wyszukiwaniem osób i danych finansowych. Zamiast tablicy `messages` z `choices` zapytanie zwraca typowaną tablicę `output` z zapisem każdego kroku agenta — rozumuj, działaj, obserwuj, kontynuuj, wszystko w jednym wywołaniu. Ciekawszy jest jednak spis modeli. Obok Sonara Agent API pośredniczy w dostępie do rodzin modeli OpenAI, Anthropic, Google, xAI, Z.AI, Moonshot AI i NVIDII. Platforma, która powstała po to, by sprzedawać jeden własny model odpowiadający, jest dziś w dużej mierze sposobem na kupno modeli wszystkich pozostałych — z wyszukiwarką Perplexity jako opakowaniem. Sam Sonar nie został wyłączony. Dokumentacja mówi, że Sonar Chat Completions jest nadal wspierany, a jednocześnie nazywa Agent API wydajniejszym i tańszym w zastosowaniach produkcyjnych — to standardowy język migracji, której nie wyznaczono jeszcze terminu. Cennik Sonar Pro pozostaje bez zmian: 3 USD za milion tokenów wejścia i 15 USD za milion wyjścia, plus 6-14 USD za 1000 zapytań, zależnie od tego, ile wyszukiwania wymagała odpowiedź. Odczytanie strategiczne jest proste. Przewagą Sonara nigdy nie było czyste rozumowanie, tylko czytanie żywego internetu i podawanie przypisów — dlatego prowadzi w testach faktograficznych w rodzaju SimpleQA, a odstaje gdzie indziej. Owinięcie tej warstwy wyszukiwania wokół dowolnego modelu, który wybierze programista, jest lepszym wykorzystaniem tego atutu niż wymaganie, żeby przyjął też model Perplexity.
Perplexity Sonar Pro →Alibaba wypuszcza Qwen3.8-Max — flagowy model o 2,4 biliona parametrów
Alibaba udostępniła 3 sierpnia 2026 model Qwen3.8-Max — największy, jaki dotąd powstał w rodzinie Qwen. To rzadka architektura mixture-of-experts: 2,4 biliona parametrów łącznie, z czego na token aktywowanych jest około 95 miliardów, przy oknie kontekstu sięgającym miliona tokenów. Model jest dostępny globalnie przez API Alibaba Cloud Model Studio oraz w QwenWork, firmowej platformie agentów do pracy biurowej. Alibaba zapowiedziała publiczne udostępnienie pełnych wag modelu, a obok nich mniejszy wariant Qwen3.8-27B, przeznaczony na wdrożenia o ograniczonych zasobach sprzętowych. W rankingu Arena.AI Qwen3.8-Max został najwyżej ocenianym chińskim modelem w zadaniach tekstowych i zajął drugie miejsce na świecie w zadaniach wizyjnych, co stawia go w jednej klasie z czołowymi systemami OpenAI i Anthropic. Po ogłoszeniu akcje Alibaby wyraźnie zwyżkowały w Hongkongu.
Qwen3.8-Max →Google wydaje Gemini 3.6 Flash — w Search, Androidzie i Workspace
Gemini 3.6 Flash, wydany 21 lipca 2026 r., kontynuuje strategię Google: szybkie, produkcyjnie przyjazne modele frontierowe wplecione w produkty — tryb AI w wyszukiwarce, asystentów Androida i Workspace. Łączy niskie opóźnienia z mocnym rozumowaniem multimodalnym, a przez linię Gemini Robotics napędza także robotykę.
Gemini 3.6 Flash →Flagowy model DeepSeeka o 1,6 biliona parametrów wchodzi do pełnej dostępności — i zaczyna liczyć według zegara
DeepSeek-V4-Pro wyszedł z fazy zapoznawczej 19 lipca 2026, trzy miesiące po pierwszej publicznej premierze. Wagi są tymi samymi, które opublikowano 24 kwietnia: rzadki model mixture-of-experts o 1,6 biliona parametrów, z czego około 49 miliardów aktywnych na token, okno kontekstu miliona tokenów i licencja MIT pozwalająca każdemu pobrać model i uruchomić go u siebie. Pełna dostępność zmieniła stronę handlową. DeepSeek po raz pierwszy wprowadził taryfę szczytową, podwajającą stawki w godzinach pracy w Pekinie; poza szczytem API kosztuje 0,435 dolara za milion tokenów wejściowych i 0,87 za milion wyjściowych. Wejście z pamięci podręcznej rozliczane jest po około setnej części stawki pozaszczytowej. 24 lipca firma wycofała stare punkty końcowe deepseek-chat i deepseek-reasoner, więc integracje muszą teraz wskazywać model wprost. Według danych opublikowanych przez DeepSeeka przy premierze GA model uzyskuje 80,6% w SWE-bench Verified — najlepszy opublikowany wynik modelu z otwartymi wagami — przy ratingu 3206 w Codeforces, 57,9% w SimpleQA Verified i 37,7% w Humanity's Last Exam. Pomiar niezależny opowiada rzecz subtelniejszą: Artificial Analysis ocenił V4-Pro na 44 punkty w Intelligence Index w momencie GA wobec 52 przy premierze zapoznawczej. Model się nie pogorszył — przez te trzy miesiące przesunęła się stawka. Mniejszy DeepSeek-V4-Flash i wcześniejszy DeepSeek-R1 pozostają dostępne, a wszystkie trzy mają już profile w katalogu wujec.ai.
DeepSeek-V4-Pro →Anthropic wydaje Claude Sonnet 5 z natywnym kontekstem 1M tokenów
Wydany 30 czerwca 2026 r. Claude Sonnet 5 to frontierowy koń roboczy Anthropic: 63,2% w SWE-Bench Pro, natywne okno kontekstu miliona tokenów i wysoka niezawodność użycia narzędzi w cenie Sonneta. Został domyślnym modelem planów free i Pro, wnosząc frontierowe kodowanie agentowe do mainstreamu.
Claude Sonnet 5 →