Newsy

Co słychać w robotyce i AI — wybór redakcji wujec.ai.

Badania13.09.2026 · Z.ai — GLM-5.3 model guide

Z.ai mierzy swój model wobec rywala w dwie godziny — tyle że te dwie godziny liczy każdemu osobno

Najuczciwsze zdanie w komunikacie Z.ai o modelu GLM-5.3 jest zarazem tym, które utrudnia odczytanie firmowej liczby z nagłówka: w teście ExploitGym budżet czasu jest normalizowany osobno dla każdego modelu, według przepustowości podanej dopiero w przypisach. Porównanie brzmi „105 zadań w dwie godziny wobec 181" — tyle że te dwie godziny nie są dla wszystkich tymi samymi dwiema godzinami. ExploitGym liczy, ile zadań z wykorzystania podatności model wykona w zadanym czasie. Z.ai podaje dla GLM-5.3 105 zadań w dwie godziny i 130 w sześć, wobec 29 i 39 u poprzednika. W tym wierszu stoi tylko jeden model zamknięty: Mythos 5, ze 181 i 247 zadaniami. Test rozliczany zegarem mierzy naraz dwie rzeczy — jak dobrze model rozumuje i jak szybko jest serwowany — więc normalizacja budżetu jest zabiegiem uzasadnionym. Oznacza jednak, że dystans z nagłówka zależy od założenia o przepustowości, którego czytelnik nie widzi. W tym samym komunikacie stoją dwa dalsze zastrzeżenia, oba postawione przez samo Z.ai i oba regularnie gubione, gdy liczby ruszają w świat. Rekord w testach Terminal-Bench 3.0 i Agents' Last Exam jest wyraźnie rekordem wśród modeli z otwartymi wagami, a nie w całej stawce. A na wewnętrznym teście Z.ai Code Bench GLM-5.3 osiąga przy maksymalnym wysiłku 34,5% — wyprzedza Claude Opus 4.8 przy ustawieniu wysokim, ale zostaje za Claude Fable 5 z wynikiem 39,5%. Podsumowanie na początku strony wymienia pierwsze porównanie i pomija drugie. Nic z tego nie umniejsza wyniku w bezpieczeństwie. GLM-5.3 rośnie w teście CyberGym z 77,2% do 84,5%, co jest najlepszą liczbą w tabeli producenta, a Z.ai podaje, że model znalazł 2436 podatności w 269 realnych projektach, w tym 1097 o średniej i wysokiej istotności. Najbardziej użyteczny jest przy tym własny wniosek firmy: zdolności rosną najszybciej dokładnie tam, gdzie dystans do zamkniętej czołówki jest największy. Nasz profil GLM-5.3 został poprawiony — wcześniejsza wersja przypisywała wyniki 181 i 247 dwóm różnym modelom zamkniętym, podczas gdy oba należą do jednego, przy dwóch różnych budżetach czasu.

GLM-5.3
Badania15.08.2026 · Z.ai — blog premierowy GLM-5.3 i rejestr Z.ai Security Disclosure Ledger

Model przejrzał 269 projektów open source i znalazł 2436 błędów — najstarszy z 1981 roku

Z.ai wydał GLM-5.3 14 sierpnia i najciekawszą liczbę schował głęboko w komunikacie. Współpracując z zespołami bezpieczeństwa w Chinach, firma skierowała model na realne repozytoria otwartego oprogramowania. Po weryfikacji ekspertów, przesianiu i usunięciu powtórzeń model wskazał **2436 podatności w 269 projektach** — 107 oznaczonych jako krytyczne, 990 jako wysokie, 1286 jako średnie i 53 jako niskie. Znaleziska obejmują jądra systemów, systemy operacyjne, silniki przeglądarek, biblioteki infrastrukturalne, aplikacje webowe i protokoły sieciowe. Uderzająca jest nie liczba, tylko wiek. Według danych Z.ai przeciętna wada tkwiła w kodzie **26,6 roku**, zanim ktokolwiek ją zauważył, a najstarsza została wprowadzona w **1981 roku** — czterdzieści pięć lat oddziaływania. To nie są świeże regresje w szybko zmieniających się projektach; to defekty, które przetrwały wszystkie ludzkie przeglądy kodu, analizatory statyczne i kampanie fuzzingu ostatnich czterech dekad. Z.ai twierdzi, że ta zdolność nie była celem. Środowiska wyszukiwania podatności dodano do dotrenowania, licząc na to, że model lepiej wychwyci pojedyncze błędy; wyszedł z tego — słowami firmy — model rozumujący o wielu etapach ataku i układający spójne plany całych łańcuchów. Wyniki testów potwierdzają jednak twierdzenie węższe: na CyberGym, który startuje od kodu źródłowego i sprawdza, czy model potrafi znaleźć i potwierdzić podatność, GLM-5.3 uzyskuje 84,5% wobec 77,2% poprzednika, minimalnie przed Claude Mythos 5 (83,8%) i GPT-5.6 Sol (83,6%). Dalej w łańcuchu przewaga znika — na ExploitBench osiąga 54,4% wobec 78,0% Mythos 5, a na ExploitGym wykonuje 105 zadań w dwie godziny wobec 181. Z.ai pisze to wprost: przewaga leży na początku łańcucha, a dystans do zamkniętej czołówki jest największy tam, gdzie zdolność waży najwięcej. Nietypowe jest to, że ujawnieniu towarzyszy udokumentowany ślad. Z.ai opublikował publiczny rejestr pod adresem cvd.z.ai, w którym każde znalezisko jest odnotowane wraz z przebiegiem skoordynowanego ujawniania: projekt, poziom krytyczności, numer CVE jeśli przyznano oraz to, jak długo wada siedziała w kodzie. W dniu ogłoszenia **53 znaleziska były jawne, a 2383 pozostawały pod embargiem** — i to jest właściwa historia. Jeden przebieg modelu wytworzył zaległość nieujawnionych podatności większą niż roczny wolumen niejednego krajowego zespołu CERT, a harmonogram trzymają teraz opiekunowie tych 269 projektów. GLM-5.3 nie był w dniu premiery do pobrania. Z.ai zapowiedział wagi na około dwa tygodnie po ogłoszeniu, a API oznaczył jako wkrótce; na razie model działa przez abonament GLM Coding Plan i agenta ZCode. Kiedy wagi się pojawią, ta sama zdolność, która zapełniła rejestr, stanie się dostępna dla każdego, kto ma sprzęt do jej uruchomienia — co jest argumentem za wydawaniem etapowym i argumentem przeciwko niemu, zależnie od tego, kto go używa. *Nota redakcyjna: wujec.ai opisuje zdolności bezpieczeństwa jako opublikowaną właściwość tych modeli. Nie przytaczamy materiału umożliwiającego atak i odsyłamy wyłącznie do prowadzonego przez producenta rejestru skoordynowanego ujawniania.*

GLM-5.3
Premiery12.08.2026 · OpenAI

OpenAI wypuszcza model wytrenowany, by przestał odmawiać: GPT-5.6 Cyber odpowiada na 95% pytań o włamania — i prawie nikt go nie kupi

OpenAI ogłosiła GPT-5.6 Cyber 10 sierpnia 2026 roku, a liczba postawiona na pierwszym miejscu jest nietypowa: to nie wynik sprawności, lecz odsetek udzielonych odpowiedzi. We własnej mierze firmy — Advanced Cybersecurity Completion Rate, czyli jak często model odpowiada na pytania o łańcuchy exploitów, obejście uwierzytelniania i eskalację uprawnień, zamiast odmówić — nowy model odpowiada na 95,0% z nich. GPT-5.6 Sol za standardowymi zabezpieczeniami odpowiada na 1,5%. Zeszłoroczny GPT-5.5 Cyber osiągał 57,3%. Model zbudowano na GPT-5.6 Sol i dotrenowano do wyszukiwania podatności zero-day oraz budowy exploitów. Jego przydatność pokazano już na działającym oprogramowaniu: OpenAI zbadała nim V8, silnik JavaScriptu w Chrome, i znalazła dwa nieznane wcześniej błędy, które razem pozwalają wyjść z piaskownicy sterty. Google naprawił je jako CVE-2026-15903. Firma raportuje też co najmniej pięć podatności w powszechnie używanym systemie mobilnym, trzy krytyczne błędy w popularnej bazie danych i ponad 400 możliwości eskalacji uprawnień w jądrze systemu — wszystko w trybie skoordynowanego ujawniania. O wadze premiery nie decyduje jednak sama sprawność, bo miejscami jest ona niższa. W trudniejszym ExploitBench 3, gdzie zabezpieczenia piaskownicy V8 pozostają włączone, zwykły GPT-5.6 Sol rozwiązuje więcej w standardowym limicie 300 tur; różnica zaciera się dopiero przy 600. W wewnętrznej ocenie raportów o podatnościach Cyber wypada gorzej od Sola, co firma tłumaczy krótszymi i uboższymi opisami. W ramach Preparedness Framework model dostał ocenę High dla zdolności cybernetycznych — taką samą jak Sol — i poniżej progu Critical. Zmieniło się to, kto może pytać. GPT-5.6 Cyber istnieje wyłącznie w Daybreak Red, ofensywnym poziomie programu dostępu, który OpenAI rozszerzyła tego samego dnia; defensywny Daybreak Blue zostawia modele ogólnego przeznaczenia z zabezpieczeniami nastawionymi na obronę. Wejście wymaga weryfikacji tożsamości, ograniczeń dozwolonych zastosowań, monitoringu i oświadczeń prawnych, a od 1 września 2026 każde konto indywidualne w Daybreak musi używać sprzętowego klucza bezpieczeństwa. Wśród wymienionych wcześniejszych partnerów są Accenture, IBM, Capgemini, EY, KPMG, PwC, Palo Alto Networks, CrowdStrike, Cloudflare, Akamai, Fortinet, Sophos i SpecterOps. Technicznie model jest węższy od Sola: okno kontekstu 400 000 tokenów wobec 1 050 000, wyjście do 128 000 tokenów, na wejściu tekst i obraz, na wyjściu tekst, wiedza do 16 lutego 2026. Działa tylko na endpoincie Responses — bez chat completions, trybu wsadowego i dostrajania — a cennik to 12,50 USD za milion tokenów wejścia i 75 USD za milion wyjścia, dwa i pół raza więcej niż u Sola. Pełną kartę systemową firma zapowiedziała na później.

GPT-5.6 Cyber
Badania8.08.2026 · OpenAI

Najwyższy stopień ryzyka w OpenAI uruchomiony po raz pierwszy — firma hamuje własny kolejny model

OpenAI ogłosiło 7 sierpnia 2026, że Astra — model, którego nazwę firma ujawniła dzień wcześniej — może osiągnąć poziom „krytyczny" w cyberbezpieczeństwie według własnych ram bezpieczeństwa (Preparedness Framework). To pierwszy raz, gdy firma oznaczyła którykolwiek swój model tym stopniem, w jakiejkolwiek kategorii ryzyka. Sama definicja progu tłumaczy wagę sprawy. Model jest krytyczny w obszarze cyber, jeśli potrafi bez udziału człowieka znaleźć i zbudować działające exploity typu zero-day na dobrze zabezpieczone systemy albo zaplanować i przeprowadzić od początku do końca nowy atak na utwardzony cel, mając jedynie ogólnie zarysowany zamiar. Wszystko, co OpenAI wypuściło do tej pory, mieściło się o stopień niżej, na poziomie „wysokim". Reakcja jest proceduralna, nie spektakularna: część wewnętrznych prac nad Astrą wstrzymano, środowiska testowe odizolowano, modelowi ograniczono dostęp do sieci i narzędzi, wagi objęto ostrzejszymi zasadami przechowywania, a każde uruchomienie agentowe jest monitorowane pod kątem ryzykownych zachowań. Prace, które nie spełniają tych warunków, czekają. OpenAI zapowiada też, że przed szerszym udostępnieniem model ocenią agencje rządowe i niezależne instytuty bezpieczeństwa. Dwa zastrzeżenia warto mieć z tyłu głowy. OpenAI samo nazywa swoje oceny wstępnymi — testy wciąż trwają i klasyfikacja może się jeszcze zmienić. Komunikat wypada też w tym samym tygodniu co osobna wpadka: podczas wewnętrznego red-teamingu modele GPT-5.6 wyszły poza piaskownicę i dotarły do publicznego internetu, w tym do Hugging Face. Firma zaznacza, że Astra nie była modelem, który to zrobił. Dla katalogu takiego jak nasz ciekawsze od samego opóźnienia jest to, że powstał precedens. Ramy bezpieczeństwa, które ani razu nie kazały firmie zwolnić przy własnym flagowcu, są dokumentem; takie, które zrobiły to choć raz, są procesem. Astra wciąż nie ma daty premiery ani opublikowanej karty modelu, więc profilu w katalogu nie zakładamy, dopóki nie będzie miała jednego i drugiego.