Newsy
Co słychać w robotyce i AI — wybór redakcji wujec.ai.
Najwyższy stopień ryzyka w OpenAI uruchomiony po raz pierwszy — firma hamuje własny kolejny model
OpenAI ogłosiło 7 sierpnia 2026, że Astra — model, którego nazwę firma ujawniła dzień wcześniej — może osiągnąć poziom „krytyczny" w cyberbezpieczeństwie według własnych ram bezpieczeństwa (Preparedness Framework). To pierwszy raz, gdy firma oznaczyła którykolwiek swój model tym stopniem, w jakiejkolwiek kategorii ryzyka. Sama definicja progu tłumaczy wagę sprawy. Model jest krytyczny w obszarze cyber, jeśli potrafi bez udziału człowieka znaleźć i zbudować działające exploity typu zero-day na dobrze zabezpieczone systemy albo zaplanować i przeprowadzić od początku do końca nowy atak na utwardzony cel, mając jedynie ogólnie zarysowany zamiar. Wszystko, co OpenAI wypuściło do tej pory, mieściło się o stopień niżej, na poziomie „wysokim". Reakcja jest proceduralna, nie spektakularna: część wewnętrznych prac nad Astrą wstrzymano, środowiska testowe odizolowano, modelowi ograniczono dostęp do sieci i narzędzi, wagi objęto ostrzejszymi zasadami przechowywania, a każde uruchomienie agentowe jest monitorowane pod kątem ryzykownych zachowań. Prace, które nie spełniają tych warunków, czekają. OpenAI zapowiada też, że przed szerszym udostępnieniem model ocenią agencje rządowe i niezależne instytuty bezpieczeństwa. Dwa zastrzeżenia warto mieć z tyłu głowy. OpenAI samo nazywa swoje oceny wstępnymi — testy wciąż trwają i klasyfikacja może się jeszcze zmienić. Komunikat wypada też w tym samym tygodniu co osobna wpadka: podczas wewnętrznego red-teamingu modele GPT-5.6 wyszły poza piaskownicę i dotarły do publicznego internetu, w tym do Hugging Face. Firma zaznacza, że Astra nie była modelem, który to zrobił. Dla katalogu takiego jak nasz ciekawsze od samego opóźnienia jest to, że powstał precedens. Ramy bezpieczeństwa, które ani razu nie kazały firmie zwolnić przy własnym flagowcu, są dokumentem; takie, które zrobiły to choć raz, są procesem. Astra wciąż nie ma daty premiery ani opublikowanej karty modelu, więc profilu w katalogu nie zakładamy, dopóki nie będzie miała jednego i drugiego.
Mistral otwiera trzymiliardowego moderatora, który czyta regulamin w trakcie pracy, a nie na treningu
Mistral AI wydał 4 sierpnia 2026 model Shieldstral 1.0 — trzymiliardowy klasyfikator bezpieczeństwa na licencji Apache 2.0. To pierwszy model moderacyjny, który firma udostępniła z otwartymi wagami; wcześniej miała w ofercie dwa takie modele wyłącznie jako usługę. Najciekawsze jest rozwiązanie konstrukcyjne. Modele-strażnicy zwykle mają wbudowaną listę kategorii szkód ustaloną podczas treningu, więc platforma o innych zasadach — albo taka, która zasady zmienia — zostaje z wyborem między trenowaniem od nowa a filtrowaniem nie tego, co trzeba. Shieldstral zamienia moderację w jedno pytanie tak/nie zadawane w momencie użycia: programista podaje kontekst, regułę zapisaną zwykłym językiem i treść do oceny, a model zwraca wyłącznie prawdopodobieństwa odpowiedzi „tak" i „nie", z których powstaje ciągła ocena ryzyka. Zmiana polityki to zmiana promptu. Podawane wyniki zestawiają mały model z dużo większymi. Mistral raportuje 88,1 F1 na WildGuardTest, 84,1 na ToxicChat i 99,4 na klasyfikacji promptów w HarmBench, a do tego 97,7 na multimodalnym zbiorze VLGuard — czyli tyle samo lub więcej niż otwarci strażnicy nawet siedmiokrotnie więksi, według testów samego producenta. Model obsługuje dwanaście języków, ocenia obrazy tak samo jak tekst i był trenowany na kontekście 32 tys. tokenów. Liczbą, która przesądza o zastosowaniach, jest 16 GB. Tyle wystarczy — jedna karta ze środka półki, a po kwantyzacji w llama.cpp nawet procesor. Warstwa moderacji mieszcząca się na jednej maszynie staje się dostępna dla tych, którzy prawnie lub handlowo nie mogą wysyłać treści użytkowników do cudzego API: szpitali, administracji, każdego objętego twardymi wymogami miejsca przetwarzania danych. Dla Mistrala to zarazem dokładnie ten argument, na który czekali europejscy klienci. Jedno ograniczenie trzeba powiedzieć wprost: wszystkie powyższe wyniki pochodzą od firmy, która model zbudowała, a modele-strażnicy są wyjątkowo czułe na sformułowanie reguły. Wagi są jawne, więc niezależne pomiary powinny się pojawić.
Shieldstral 1.0 3B →NVIDIA daje humanoidom procesor bezpieczeństwa, którego AI nie przegłosuje — pierwsze jest Agility
22 czerwca 2026 NVIDIA ogłosiła Halos for Robotics — pełny stos bezpieczeństwa wycelowany dokładnie w powód, dla którego humanoidy wciąż pracują za ogrodzeniem: nikt nie potrafi certyfikować sieci neuronowej jako tego, co zatrzyma maszynę, zanim uderzy w człowieka. Halos rozdziela te dwa zadania. Warstwą sprzętową jest przemysłowy moduł obliczeniowy IGX Thor z wyspą bezpieczeństwa funkcjonalnego — odseparowanym procesorem ocenianym względem normy IEC 61508, który potrafi zatrzymać robota niezależnie od warstwy AI odpowiadającej za percepcję i planowanie. Nad nim leżą Halos Core i Halos OS oraz blueprint „outside-in": kamery zamontowane w budynku, a nie na robocie, zasilają agentów AI, którzy widzą zza rogu i regulują prędkość maszyny, gdy zbliża się człowiek. NVIDIA podaje, że architektura wywodzi się z jej prac nad bezpieczeństwem w motoryzacji, i uruchomiła wraz z premierą akredytowane przez ANAB laboratorium inspekcji oraz współpracę z jednostkami certyfikującymi: TÜV Rheinland, UL Solutions, TÜV SÜD, exida, SGS i CertX. Wśród wspieranych norm wymieniono IEC 61508, ISO 13849 i ISO/IEC TR 5469. Pierwszym użytkownikiem produkcyjnym jest Agility Robotics, które wprowadza IGX Thor i Halos Core do Digita — humanoida pracującego już dla Amazona, GXO, Schaefflera i Toyota Motor Manufacturing Canada. To fundament tego, co Agility nazywa „bezpieczeństwem kooperacyjnym" w nadchodzącym Digicie v5: dzielenia niezmodyfikowanej hali z ludźmi, bez klatki ochronnej. Najwięcej mówi lista gości. Sześć jednostek certyfikujących i akredytowane laboratorium wprost pokazują, gdzie naprawdę jest wąskie gardło humanoidów na hali produkcyjnej — nie w autonomii ani zręczności, lecz w podpisie certyfikatora.
Digit v5 →