MiniMax otwiera wagi modelu wideo 2K, ktory sam generuje sciezke stereo
Opublikowano: 3.08.2026 · Źródło: MiniMax ↗
Trzy dni po premierze H3 na konsumenckiej platformie Hailuo MiniMax opublikowal wagi modelu na Hugging Face i ModelScope, na wlasnej licencji Community. Firma przedstawia to jako korekte nierownowagi: modele jezykowe rozwijaja sie w otwartosci, a generowanie wideo pozostawalo domena systemow zamknietych, z wolniejszym cyklem i bez ekosystemu wokol.
Udostepniono gesty transformer H3-Base o 33 miliardach parametrow, sprzezony z zamrozonym enkoderem Qwen3-VL-32B, oraz modul, ktory przebudowuje jego szkic 768-pikselowy do 2K. Wynik ma od 4 do 15 sekund przy 24 kl./s i dzwiek stereo 32 kHz, w proporcjach od 21:9 do 9:16, z dialogiem mowionym stabilnym w jedenastu jezykach. Model czyta tekst, obrazy, wideo i dzwiek jako jeden kontekst: polecenie moze kazac mu przejac ruch kamery z jednego klipu, twarz ze zdjecia i glos z pliku audio, opisane zwyklym jezykiem, a nie wybrane z zamknietej listy zadan.
Jedna czesc pozostala zamknieta. H3-Context-IR, warstwa interpretujaca te mieszane materialy i sprowadzajaca je do formy oczekiwanej przez model bazowy, opiera sie na modelach hostowanych i nie zostala otwarta. MiniMax nazywa ja krytyczna dla jakosci wyniku, udostepnia do niej API i przewodnik dla tych, ktorzy chca zbudowac wlasny zamiennik — w pelni samodzielny potok jest wiec mozliwy, ale nie z orkiestracja producenta. Na platformie MiniMaxa sekunda wideo 2K kosztuje 0,13 dolara, a 768p 0,08 dolara; wygenerowany dzwiek jest bezplatny.