Grok Imagine Video 1.5
xAI · USA · 2026
Model wideo xAI: do 15 sekund w natywnym 1080p, ze zdjęciami referencyjnymi i gotowym głosem dla postaci.
Grok Imagine Video 1.5 to model wideo xAI drugiej generacji, dostępny przez to samo API Imagine, co modele obrazowe firmy. Tworzy klipy o długości od jednej do piętnastu sekund - z opisu tekstowego, ze zdjęcia albo z zestawu obrazów referencyjnych - i jako pierwszy model wideo tej firmy renderuje tryby tekst-do-wideo oraz zdjęcie-do-wideo w natywnym 1080p, a nie przez powiększenie niższej rozdzielczości. Generowanie z tekstu nie jest tu jednym przebiegiem: producent pisze w dokumentacji, że model najpierw tworzy z opisu pierwszą klatkę, a dopiero potem wprawia ją w ruch, przy czym obraz pośredni nie wraca do użytkownika. Tryb referencyjny działa inaczej niż zdjęcie-do-wideo: obrazy podpowiadają wygląd postaci lub przedmiotu, ale nie ustalają pierwszej klatki. Producent wskazuje na przymierzanie ubrań, lokowanie produktu i opowieści z powracającym bohaterem. Model potrafi też dać postaci głos: do trzech gotowych głosów z tej samej listy, co w modelach mowy firmy, można dołączyć do zapytania i oznaczyć w opisie. Klonowanie głosu z własnego nagrania nie jest ogólnie dostępne - firma udostępnia je wybranym partnerom na życzenie. Dwa kolejne punkty API przedłużają istniejący klip od ostatniej klatki i edytują gotowe nagranie; edycja jest ograniczona do 720p i około 8,7 sekundy. Przy stawce 0,08 USD za sekundę materiału model kosztuje o sześćdziesiąt procent więcej niż wideo pierwszej generacji tej firmy, a w odróżnieniu od niego nie działa w tańszym trybie wsadowym - xAI odrzuca oba modele Imagine 1.5 komunikatem o braku obsługi przetwarzania wsadowego.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!