MDL-3698EST.2025 · IDX.385
WideoW produkcji

Wan2.1-FLF2V-14B-720P

Alibaba Cloud · China · 2025

Podajesz pierwszą i ostatnią klatkę, a model wymyśla ujęcie pomiędzy nimi. Jedno zastrzeżenie producent stawia wprost: uczony był głównie na chińskich opisach i lepiej działa na chińskich poleceniach.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Wan2.1-FLF2V-14B-720P, wydany 17 kwietnia 2025 roku na licencji Apache 2.0, to w rodzinie Wan 2.1 model od pierwszej i ostatniej klatki, a zarazem najbardziej sterowalny z nich. Pozostałe modele animujące zdjęcie dostają obraz początkowy i same decydują, dokąd zmierza ujęcie. Ten dostaje oba końce — klatkę, od której ma zacząć, i klatkę, na której ma wylądować — i musi zbudować między nimi wiarygodną drogę w rozdzielczości 1280×720. Tak właśnie wygląda zadanie w filmie i animacji. Scenopis ustala, gdzie ujęcie się zaczyna i kończy; pracą jest ruch pomiędzy. Związanie obu końców usuwa też usterkę, przez którą otwartych modeli animujących zdjęcie trudno używać w sekwencji: każdy kolejny materiał odpływa w miejsce, z którego następny nie potrafi podjąć. Model dzieli szkielet z całą generacją — transformator dyfuzyjny o 40 warstwach i szerokości 5120, z 40 głowicami, koder tekstu umt5-xxl z pułapem 512 tokenów, koder wizyjny CLIP i autoenkoder Wan — a jego pliki wag liczą 16,4 miliarda parametrów wobec 14 miliardów w nazwie; nadwyżką jest znów ścieżka warunkowania. Obsługiwane jest wyłącznie 720p, wersji standardowej nie ma. Zastrzeżenie stawia sama Alibaba i warto je powtórzyć, a nie ukryć. Model pierwszej i ostatniej klatki trenowano głównie na chińskich parach tekst-wideo, a producent zaleca pisanie poleceń po chińsku dla lepszych wyników. Każdy inny model tej rodziny przedstawiany jest jako dwujęzyczny bez zastrzeżeń; to jedyne miejsce, w którym dokumentacja przyznaje, że oba języki nie są obsłużone równo. Użycie odpowiada węższemu zadaniu: około 1800 pobrań miesięcznie, ułamek zwykłych modeli animujących zdjęcie, przy 228 polubieniach — zainteresowanie jest nieproporcjonalnie duże wobec ruchu. Podobnie jak w siostrzanej wersji 720p, pliku LICENSE.txt, do którego odsyła karta modelu, w tym repozytorium nie ma.

#image to video#video generation#open weights#apache 2.0
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję