Shieldstral to pierwszy model bezpieczeństwa Mistral AI z otwartymi wagami: trzymiliardowy klasyfikator, który ocenia, czy tekst albo obraz łamie regułę zapisaną przez programistę zwykłym językiem — dopiero w momencie użycia. Zamiast sztywnej listy kategorii szkód utrwalonej podczas treningu moderacja staje się pytaniem tak/nie: model zwraca wyłącznie prawdopodobieństwa odpowiedzi „tak" i „nie", z których powstaje ciągła ocena ryzyka. Zmiana polityki wymaga więc zmiany promptu, a nie ponownego trenowania. Model wydano 4 sierpnia 2026 na licencji Apache 2.0, na bazie Ministral 3B; obsługuje dwanaście języków i ocenia tekst, obrazy albo jedno i drugie naraz. Mistral podaje, że dorównuje otwartym strażnikom nawet siedmiokrotnie większym — 88,1 F1 na WildGuardTest i 97,7 na multimodalnym VLGuard. Mieści się na jednej karcie 16 GB, więc warstwa moderacji staje się dostępna także dla zespołów, które nie mogą wysyłać treści użytkowników do cudzego API.