Premiery22.08.2026 · xAI developer documentation (pricing, release notes, Batch API)Nowy model wideo xAI kosztuje o 60% więcej za sekundę — i jako jedyny nie wchodzi do własnego trybu wsadowego
Dokumentacja deweloperska xAI wymienia dziś dwie generacje modelu wideo obok siebie, a różnica między nimi nie jest wyłącznie techniczna. Grok Imagine Video 1.5, którego pełen zestaw trybów ogłoszono 31 lipca 2026 roku, kosztuje 0,080 USD za sekundę wygenerowanego materiału. Model pierwszej generacji, grok-imagine-video, wciąż stoi w cenniku po 0,050 USD za sekundę — nowszy jest więc droższy o 60 procent.
Za wyższą stawkę użytkownik dostaje natywne 1080p w trybach tekst-do-wideo i zdjęcie-do-wideo, zamiast renderu w niższej rozdzielczości powiększanego po fakcie, a do tego tryb referencyjny, w którym kilka obrazów podpowiada wygląd postaci lub przedmiotu, nie ustalając pierwszej klatki, oraz możliwość dołączenia do trzech gotowych głosów. Klipy trwają od jednej do piętnastu sekund; osobne punkty API przedłużają gotowe nagranie od ostatniej klatki albo je edytują, przy czym edycja jest ograniczona do 720p i około 8,7 sekundy.
Mniej reklamowana część stoi w dokumentacji trybu wsadowego. Batch API xAI, które przetwarza duże wolumeny zapytań asynchronicznie i taniej, przyjmuje zlecenia obrazowe i wideo wyłącznie dla modeli pierwszej generacji: grok-imagine-image i grok-imagine-video. Oba modele generacji 1.5 — wideo oraz Grok Imagine Image 2.0 — są odsyłane komunikatem o braku obsługi przetwarzania wsadowego. Dla kogoś, kto generuje materiał hurtowo, nowszy model jest zatem droższy podwójnie: wyższa stawka za sekundę i brak dostępu do tańszej kolejki.
Dokumentacja zdradza też, jak naprawdę działa w tym modelu generowanie z opisu. To nie jest jeden przebieg: producent pisze, że model najpierw tworzy z opisu pierwszą klatkę, a dopiero potem wprawia ją w ruch. Obraz pośredni nie wraca do użytkownika, choć całość jest jednym płatnym zapytaniem.
Grok Imagine Video 1.5 →