GLM-Image
Z.ai (Zhipu AI) · China · 2026
Model obrazowy o 6,9 mld parametrów wymierzony w najtrudniejszą rzecz w tej dziedzinie: obrazy z poprawnym tekstem.
GLM-Image to flagowy generator obrazów Z.ai, opublikowany w styczniu 2026. To, co odróżnia go od większości konkurencji, producent mówi wprost: model jest zbudowany do obrazów nasyconych informacją — plakatów, slajdów, rysunków objaśniających — a nie do fotorealizmu czy sztuki. Właśnie tam generatory tradycyjnie zawodzą, bo trzeba wpisać w obraz tekst, który da się przeczytać, utrzymać czytelną hierarchię i spójność między kilkoma kadrami. Architektura to hybryda, którą firma nazywa „autoregresja plus dekoder dyfuzyjny”: część autoregresyjna odpowiada za globalne zrozumienie polecenia, dekoder dyfuzyjny za detal. Z.ai ustawia to jako swoje wejście w nurt „generowania poznawczego”, którego przykładem jest Nano Banana Pro. Stąd biorą się opisane zastosowania: plakaty reklamowe z precyzyjnie osadzonym tekstem, ilustracje popularnonaukowe z opisami i strzałkami procesu, wielokadrowe układy sklepowe i komiksowe, w których bohater ma pozostać rozpoznawalny z kadru na kadr, oraz grafiki do mediów społecznościowych o złożonym layoucie. Parametry praktyczne są skromne i jasno podane. Na wejściu tekst, na wyjściu obraz — zwracany jako adres URL, który trzeba pobrać, a nie jako dane w odpowiedzi. Proporcje to m.in. 1:1, 3:4, 4:3 i 16:9; szerokość i wysokość można ustawić dowolnie między 512 a 2048 pikselami, byle każda była wielokrotnością 32. Wygenerowanie obrazu kosztuje 0,015 USD, o połowę więcej niż starszy CogView-4 po 0,01 USD. Jak na model obrazowy rzecz nietypowa: wagi są jawne. Z.ai wydało GLM-Image na Hugging Face na licencji MIT, a indeks plików safetensors daje 6,93 mld parametrów — na tyle mało, że model zmieści się na pojedynczym akceleratorze, co jest tu sporą częścią sensu.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!