Mistral otwiera trzymiliardowego moderatora, który czyta regulamin w trakcie pracy, a nie na treningu
Opublikowano: 4.08.2026 · Źródło: Mistral AI ↗
Mistral AI wydał 4 sierpnia 2026 model Shieldstral 1.0 — trzymiliardowy klasyfikator bezpieczeństwa na licencji Apache 2.0. To pierwszy model moderacyjny, który firma udostępniła z otwartymi wagami; wcześniej miała w ofercie dwa takie modele wyłącznie jako usługę.
Najciekawsze jest rozwiązanie konstrukcyjne. Modele-strażnicy zwykle mają wbudowaną listę kategorii szkód ustaloną podczas treningu, więc platforma o innych zasadach — albo taka, która zasady zmienia — zostaje z wyborem między trenowaniem od nowa a filtrowaniem nie tego, co trzeba. Shieldstral zamienia moderację w jedno pytanie tak/nie zadawane w momencie użycia: programista podaje kontekst, regułę zapisaną zwykłym językiem i treść do oceny, a model zwraca wyłącznie prawdopodobieństwa odpowiedzi „tak" i „nie", z których powstaje ciągła ocena ryzyka. Zmiana polityki to zmiana promptu.
Podawane wyniki zestawiają mały model z dużo większymi. Mistral raportuje 88,1 F1 na WildGuardTest, 84,1 na ToxicChat i 99,4 na klasyfikacji promptów w HarmBench, a do tego 97,7 na multimodalnym zbiorze VLGuard — czyli tyle samo lub więcej niż otwarci strażnicy nawet siedmiokrotnie więksi, według testów samego producenta. Model obsługuje dwanaście języków, ocenia obrazy tak samo jak tekst i był trenowany na kontekście 32 tys. tokenów.
Liczbą, która przesądza o zastosowaniach, jest 16 GB. Tyle wystarczy — jedna karta ze środka półki, a po kwantyzacji w llama.cpp nawet procesor. Warstwa moderacji mieszcząca się na jednej maszynie staje się dostępna dla tych, którzy prawnie lub handlowo nie mogą wysyłać treści użytkowników do cudzego API: szpitali, administracji, każdego objętego twardymi wymogami miejsca przetwarzania danych. Dla Mistrala to zarazem dokładnie ten argument, na który czekali europejscy klienci.
Jedno ograniczenie trzeba powiedzieć wprost: wszystkie powyższe wyniki pochodzą od firmy, która model zbudowała, a modele-strażnicy są wyjątkowo czułe na sformułowanie reguły. Wagi są jawne, więc niezależne pomiary powinny się pojawić.