Wan2.2-I2V-A14B
Alibaba Cloud · China · 2025
Obrazowa połowa ostatniego jawnie opublikowanego flagowca wideo Alibaby: ten sam odszumiacz z dwoma ekspertami co w modelu tekstowym, tylko pierwsza klatka jest zdjęciem dostarczonym przez użytkownika.
Wan2.2-I2V-A14B ożywia nieruchome zdjęcie. Został opublikowany 28 lipca 2025 roku razem z modelem tekst-na-wideo tej samej generacji i ma dokładnie tę samą architekturę: odszumiacz z mieszanką ekspertów, w którym ekspert od wysokiego szumu obsługuje wczesne kroki, gdzie zapada układ kadru i ruch, a ekspert od niskiego szumu kończy szczegół. Każdy z nich ma około 14 miliardów parametrów, więc cały zapis liczy mniej więcej 27 miliardów, a w jednym kroku pracuje 14. W repozytorium widać to jako dwa osobne foldery modelu, high_noise_model i low_noise_model, i właśnie dlatego zwykły licznik parametrów na Hugging Face nie pokazuje dla tego pliku nic. Praktyczna różnica wobec modelu tekstowego to kontrola. Start ze zdjęcia usuwa najtrudniejszą część polecenia tekstowego — opisanie sceny na tyle precyzyjnie, żeby dostać zamierzoną kompozycję — i zostawia modelowi zadanie, w którym jest lepszy, czyli decyzję, jak ta scena ma się poruszyć. Wyjście to 480P albo 720P. Alibaba podaje, że Wan2.2 uczono na o 65,6 procent większym zbiorze obrazów i o 83,2 procent większym zbiorze wideo niż Wan2.1, z opisem estetycznym obejmującym światło, kompozycję, kontrast i kolor — stąd bardziej filmowy, świadomie ustawiony wygląd tej generacji. Jedno zastrzeżenie warte odnotowania: karta modelu obiecuje pełny tekst licencji w pliku LICENSE.txt, a żadne z repozytoriów Wan2.2 tego pliku nie zawiera. Deklaracja Apache 2.0 w metadanych repozytorium i w odpowiadającym mu repozytorium kodu na GitHubie pozostaje w mocy.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!