Shieldstral 1.0
Mistral AI · France · 2026
Klasyfikator bezpieczeństwa o 3,8 miliarda parametrów, który zasadę moderacji przyjmuje jako zwykłe pytanie zadane w chwili użycia — zmiana tego, co uznajemy za szkodliwe, nie wymaga więc uczenia modelu od nowa.
Shieldstral 1.0 to pierwszy opublikowany model moderacyjny Mistral AI, wydany 4 sierpnia 2026 na licencji Apache 2.0. Nie odpowiada na pytania i nie pisze tekstów — ocenia treści, które inne modele tworzą albo dostają. Od wcześniejszych modeli strażniczych odróżnia go to, gdzie mieszka reguła. Systemy takie jak LlamaGuard czy ShieldGemma mają stałą listę kategorii szkodliwości wtopioną w wagi, więc produkt potrzebujący innej definicji treści niedozwolonej musi uczyć model od nowa. Shieldstral czyta zamiast tego trzy elementy: polecenie opisujące kontekst i surowość oceny, jedno pytanie rozstrzygnięcia zadane zwykłym językiem oraz treść do oceny. To pytanie jest polityką. Forum bezpieczeństwa komputerowego i serwis zdrowia psychicznego mogą uruchomić ten sam model z innymi pytaniami i dostać różne werdykty o tym samym tekście. Sam werdykt to jedno przejście przez sieć. Model odczytuje wyłącznie prawdopodobieństwa odpowiedzi „tak” i „nie”, a następnie przelicza je na ciągły wynik pomiędzy nimi, więc operator sam ustawia próg i może porządkować przypadki graniczne według pewności, zamiast dostawać samą etykietę. Zbudowano go na bazie Ministral 3 3B z enkoderem obrazu Pixtral, dzięki czemu jeden interfejs obsługuje tekst, obrazy i tekst z obrazem. Tabele producenta stawiają go na równi z otwartymi modelami strażniczymi siedmiokrotnie większymi albo wyżej: 84,1% miary F1 w zestawie ToxicChat i 99,4% w HarmBench przy ocenie zapytań, wobec 79,8% i 94,5% u rywala o 20 miliardach parametrów. Nie wygrywa wszędzie — w wielojęzycznym zestawie RTP-LX wyraźnie odstaje — a producent sam wskazuje wielojęzyczność jako najbliższe zadanie. Warto przeczytać ograniczenia praktyczne przed wdrożeniem. Architektura obsługuje kontekst 256 tysięcy tokenów, ale uczenie prowadzono na ciągach do 32 tysięcy i producent odradza wychodzenie poza ten zakres. Model działa na jednej karcie graficznej z 16 GB pamięci i to jest sedno: moderacja kosztuje przy każdym zapytaniu, więc strażnik wymagający szafy serwerowej to strażnik, którego się pomija.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!