Nowe otwarte modele IBM mają pokrętło myślenia - i żadnego wyjątku dla Europy w licencji
Opublikowano: 31.08.2026 · Źródło: IBM Granite Team (karta modelu i blog techniczny Granite 4.2) ↗
IBM opublikował rodzinę Granite 4.2 - trzy modele rozumujące o 3, 8 i 30 miliardach parametrów, na czystej licencji Apache 2.0 bez wyłączenia terytorialnego - a środkowy z nich rozwiązuje 47,67 procent zadań SWE-bench Verified, testu naprawy oprogramowania, który do niedawna był domeną systemów z najwyższej półki.
Tym, co wyróżnia rodzinę, jest pokrętło myślenia. Zamiast wydawać osobny model rozumujący, IBM wbudował tok rozumowania w każdy rozmiar i pozwala wybierać w pojedynczym zapytaniu między pełnym myśleniem, trybem oszczędnym i brakiem myślenia w ogóle. Modele wypisują rozumowanie w znacznikach <think>, zanim odpowiedzą. Według liczb producenta wersja 30B osiąga 57 w SWE-bench Verified i 89,17 w AIME25, a 8B idzie tuż za nią z wynikami 47,67 i 86,67.
Drugi wybór jest architektoniczny i idzie pod prąd: wszystkie trzy modele są gęste. W czasach, gdy niemal każdy model tej wielkości uruchamia na każde słowo tylko ułamek swoich wag, Granite 4.2 uruchamia wszystkie. Kosztuje to obliczenia, ale znosi maszynerię routingu, przez którą mieszanki ekspertów bywają kłopotliwe na małym sprzęcie. Trening odbył się na wynajętej mocy - klastrze NVIDIA GB200 w CoreWeave - co jest wartym odnotowania szczegółem u firmy sprzedającej komputery.
Dla europejskiego czytelnika sedno tkwi w licencji. W ostatnim tygodniu opisywaliśmy w tym katalogu kilka premier z otwartymi wagami, których umowy wprost wykluczają Unię Europejską albo wiążą tylko firmy powyżej progu liczby użytkowników. Granite ma Apache 2.0 i nic ponadto: bez klauzuli terytorialnej, bez aneksu o dozwolonym użyciu, bez nawet pliku licencji z dodatkowymi warunkami w repozytorium.
Jedno zastrzeżenie należy postawić obok nagłówka. IBM wymienia dwanaście przetestowanych języków i polskiego wśród nich nie ma, a najmniejszy model zachowuje się poza angielskim zupełnie inaczej niż jego bracia: we własnym teście wielojęzycznym producenta wersja 3B osiąga 27,78 tam, gdzie 8B sięga 61,06. Wspólna karta specyfikacji przed tą różnicą nie ostrzega. Wersja 3B pominęła też etap uczenia ze wzmocnieniem w środowiskach agentowych, przez który przeszły modele 8B i 30B - i to jest bardziej prawdopodobne wyjaśnienie, dlaczego producent nie podaje dla niej żadnego wyniku SWE-bench.