Alibaba sprzedaje swoje otwarte modele wideo jako dwujęzyczne — przy jednym z nich własna karta zaleca pisanie po chińsku
Opublikowano: 4.09.2026 · Źródło: Wan-AI model card, Hugging Face ↗
Każda karta modelu w otwartej rodzinie wideo Wan 2.1 od Alibaby wymienia dwa języki — angielski i chiński — i nic więcej o różnicy między nimi nie mówi. Jedna karta wyłamuje się z tego schematu. Pod tabelą pobrań modelu Wan2.1-FLF2V-14B-720P, który buduje ujęcie między ustaloną klatką początkową a ustaloną klatką końcową, producent pisze, że dla generowania z pierwszej i ostatniej klatki trenował model głównie na chińskich parach tekst-wideo i dlatego zaleca używanie chińskiego polecenia dla lepszych wyników.
Zdanie jest pojedynczym wierszem w przypisie, który poza tym omawia rozdzielczość, i jest to jedyne miejsce w dokumentacji tej rodziny, gdzie oba reklamowane języki opisano jako nierówne. Cztery pozostałe wersje generacji — tekst-na-wideo w rozmiarach 1,3 i 14 miliardów parametrów oraz animowanie zdjęcia w 480p i 720p — noszą tę samą dwujęzyczną etykietę bez żadnego takiego zastrzeżenia.
Ma to znaczenie ze względu na przeznaczenie modelu. Generowanie z pierwszej i ostatniej klatki to najbliższy odpowiednik narzędzia scenopisowego, jaki ma otwarta scena: użytkownik ustala oba końce ujęcia, a model wymyśla ruch pomiędzy nimi — i tylko w ten sposób da się łączyć materiały tak, by kolejny nie odpływał w miejsce, z którego następny nie potrafi podjąć. Po tę właśnie wersję sięgnęłoby anglojęzyczne studio w pierwszej kolejności, i to właśnie jej dokumentacja przyznaje, że angielska strona danych treningowych była chudsza.
Liczby użycia sugerują, że model jest bardziej podziwiany niż uruchamiany. Pobierany jest około 1800 razy miesięcznie, czyli ułamek tego, co zwykłe modele animujące zdjęcie, a ma przy tym 228 polubień — wysoki stosunek zainteresowania do ruchu. Czy przypis o języku ma w tym udział, licznik pobrań nie rozstrzygnie.
wujec.ai dodał profil tego modelu oraz trzech innych wersji pierwszej generacji Wan, których katalog nie miał: modeli animujących zdjęcie w 720p i 480p, opublikowanych 25 lutego 2025 roku, oraz małego edytora wideo VACE 1.3B z 13 maja 2025 roku. Wszystkie cztery noszą etykietę Apache 2.0, choć plik licencji, do którego odsyłają karty, jest obecny w dwóch repozytoriach z czterech, a w pozostałych dwóch go brakuje.