MDL-2439EST.2026 · IDX.179
Model językowyW produkcji

IBM Granite Guardian 4.1 8B

IBM · USA · 2026

Model, którego jedynym zadaniem jest odpowiedzieć tak lub nie na pytanie o cudzą wypowiedź: sprawdza próby obejścia zabezpieczeń, zmyślone fakty i fałszywe wywołania narzędzi, a w tej wersji własne kryteria oceny można mu po prostu napisać.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Granite Guardian 4.1 8B jest sędzią, nie asystentem. Powstał przez dostrojenie modelu Granite 4.1 8B — te same 40 warstw, to samo okno 128 tys. tokenów, ten sam słownik — i nauczono go dokładnie jednej rzeczy: przeczytać polecenie albo odpowiedź i zwrócić „tak” lub „nie” wobec podanego kryterium, w znacznikach oceny. IBM pisze wprost, że każde inne użycie wykracza poza przeznaczenie modelu i może dać niebezpieczny wynik. Co sprawdza od ręki: ogólną szkodliwość, uprzedzenia społeczne, wulgarność, przemoc, treści seksualne, zachowania nieetyczne, próby obejścia zabezpieczeń, a także to, czy odpowiedź trzyma się dostarczonych dokumentów, czy odnaleziony fragment był w ogóle na temat i czy wywołanie funkcji przez agenta odpowiada narzędziom, którymi ten agent dysponuje. Dwa ostatnie punkty są istotne dla każdego, kto prowadzi system wyszukiwania albo agentów — tam awaria nie polega na wulgaryzmie, tylko na pewnym siebie zmyślonym przypisie. Nowością wersji 4.1 jest to, że lista przestała być zamknięta. Tryb własnych kryteriów pozwala operatorowi napisać regułę zwykłym językiem — wymóg formatu, limit długości, zasadę branżową — i kazać modelowi oceniać wypowiedzi względem niej. Liczby producenta pokazują tu największy skok całego wydania: trafność w wielowarunkowym teście IFEval rośnie z 0,458 do 0,844, a w teście InfoBench ocenianym przez ludzi z 0,535 do 0,706. W praktyce zamienia to filtr bezpieczeństwa w uniwersalnego egzaminatora. Model pracuje też w dwóch trybach. Z rozumowaniem wypisuje tok rozumowania przed werdyktem, co kosztuje czas i tokeny, a daje trafność przy sprawdzaniu zgodności z dokumentami — 0,76 średniej trafności zrównoważonej. Bez rozumowania zwraca sam werdykt, czyli to, czego potrzebuje filtr produkcyjny stojący przed każdym zapytaniem. Bezpieczeństwo na materiale spoza rozkładu treningowego utrzymuje się na poziomie 0,79 w mierze F1 bez rozumowania, a wykrywanie zmyślonych wywołań funkcji poprawia się z 0,74 do 0,79. Jedną liczbę trzeba czytać ostrożnie. Użyty jako model nagrody do wybierania najlepszej z kilku kandydujących odpowiedzi osiąga 70,29 w teście JETTS, wyprzedzając wszystkie sprawdzone przez IBM modele nagrody aż do 70 miliardów parametrów. To twierdzenie o wąskim zadaniu, postawione przez producenta i nikt go niezależnie nie powtórzył — ale dobrze pokazuje, po co jest mały model-sędzia. Opublikowane wagi liczą 8,38 miliarda parametrów wobec 8,79 miliarda w modelu Granite 4.1 8B, z którego powstały. Architektury są identyczne; różnica jest księgowa, bo repozytorium bazowe zapisuje wspólną macierz osadzeń dwa razy. Licencja to czysta Apache 2.0. Wyłącznie angielski, a IBM ostrzega, że sam strażnik również bywa podatny na ataki spreparowanym wejściem.

#open-weights#apache-2.0#IBM#safety#long-context
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję