Wan2.2-S2V-14B
Alibaba Cloud · China · 2025
Dostaje jedno zdjęcie i nagranie głosu, a oddaje sfilmowaną postać, która mówi — otwarty model Alibaby do gry aktorskiej sterowanej dźwiękiem, razem z długimi ujęciami i poprawianiem synchronizacji ust w gotowym materiale.
Wan2.2-S2V-14B, opublikowany 26 sierpnia 2025 roku, przyjmuje portret i ścieżkę dźwiękową, a zwraca wideo, na którym ta postać odgrywa nagranie. Kategoria nie jest nowa — robiły to wcześniej Hunyuan-Avatar i OmniHuman — ale deklarowany cel Alibaby jest inny. Istniejące systemy dobrze radzą sobie z gadającą głową albo śpiewakiem, a rozsypują się we wszystkim, co przypomina scenę filmową, gdzie postacie wchodzą w interakcje, ciało porusza się wiarygodnie, a kamera nie stoi w miejscu. Opublikowane badanie celuje wprost w tę lukę, a towarzysząca praca raportuje wygrane z obydwoma wymienionymi konkurentami. Dwa zastosowania poboczne są w praktyce chyba ważniejsze od głównego. Model generuje materiał długi, więc wynik nie jest ograniczony do jednego krótkiego ujęcia, i potrafi precyzyjnie poprawiać synchronizację ust w istniejącym wideo — czyli podmienić ruch ust w gotowym nagraniu tak, by pasował do innej ścieżki dźwiękowej. To jest problem dubbingu. W repozytorium obok wag wideo leży koder dźwięku, model wav2vec2, i właśnie dlatego licznik parametrów pokazuje 16,3 miliarda dla zapisu nazwanego 14B; sam model wideo to ta część czternastomiliardowa. Piątego września 2025 roku Alibaba dołożyła do potoku syntezator mowy CosyVoice, więc dźwięk sterujący można wygenerować z tekstu zamiast go nagrywać. Wyjście to 480P albo 720P. Licencja to Apache 2.0 według metadanych repozytorium, choć podobnie jak w całej generacji Wan2.2 brakuje pliku licencji, na który wskazuje karta modelu.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!