MDL-9772EST.2026 · IDX.933
AudioPrototyp

Fun-CineForge

Alibaba Cloud · China · 2026

Otwarty model dubbingowy z laboratorium FunAudioLLM Alibaby: wypowiada kwestię wybranym głosem, w rytm ust aktora, w scenach monologu, narracji, dialogu i wielu mówiących naraz. Rozprowadzany jako kompletny warsztat, z rozpoznawaniem twarzy włącznie.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Fun-CineForge to otwarty model do dubbingowania filmu i telewizji. Dostaje ujęcie, scenariusz z czasami i głos wzorcowy, a następnie wypowiada kwestię tak, żeby pasowała do ust aktora. Zbudowano go pod te przypadki, na których dubbing zwykle się sypie: narracja pod sceną, dwoje ludzi mówiących jedno przez drugie, tłum, w którym mówiący zmienia się co kilka sekund. Nietypowe jest to, co przychodzi w paczce. To nie jest jeden model, tylko działający warsztat: 12,68 GiB w 42 plikach. Sam głos powstaje z modelu językowego o wielkości około 5,8 GB, na szkielecie Qwen2-0,5B CosyVoice, z modułem dopasowania przepływu o wielkości 3,8 GB i wokoderem. Wokół nich leżą narzędzia potrzebne do zrozumienia materiału: separacja wokalu, żeby zdjąć muzykę z oryginalnej ścieżki, wykrywanie mowy, weryfikacja mówiącego, wykrywanie osoby aktualnie mówiącej, wykrywanie twarzy, punkty charakterystyczne twarzy, ocena jakości kadru twarzy oraz sieć rozpoznawania twarzy o wielkości 249 MB. Model dubbingowy musi wiedzieć, która twarz na ekranie mówi, więc przychodzi z aparaturą do rozpoznawania twarzy — rzecz warta odnotowania w paczce, którą wielu zainstaluje bez czytania listy plików. Obok modelu zespół opublikował swój potok przygotowania danych, i to jest prawdopodobnie większy wkład: udokumentowana droga od surowych odcinków serialu do opisanych danych dubbingowych, a wraz z nią zbiór CineDub-CN, przedstawiany jako pierwszy duży chiński zbiór dubbingowy z telewizji, rozszerzony później na angielski jako CineDub-EN. Jeden krok tej drogi łatwo przeoczyć, a mówi on sporo o stanie dziedziny. Etap czyszczenia, który poprawia wyniki modeli wyspecjalizowanych, wywołuje przez API ogólny model wielomodalny — a udokumentowanym ustawieniem domyślnym jest Gemini 3 Pro firmy Google. Otwarty potok Alibaby sięga po komercyjny model konkurenta, żeby sprawdzić własną robotę. Producent podaje, ile na tym zyskuje: udział błędnych znaków spada z 4,53 do 0,94 procent, a błąd rozdzielania mówiących z 8,38 do 1,20 procent, co określa jako poziom porównywalny z ręczną transkrypcją albo lepszy. Historia wydania biegnie od zestawu narzędzi do danych w grudniu 2025, przez obsługę angielskiego w lutym 2026, po kod uruchomieniowy i wagi 16 marca 2026. Języki: wyłącznie chiński i angielski. Repozytorium nosi etykietę Apache 2.0, ale karta stwierdza wprost, że to artefakt badawczy, a nie komercyjny produkt Tongyi Lab, i że próbki zbioru danych mają własne warunki. Producent podaje, że uruchomienie mieści się na karcie graficznej klasy konsumenckiej; interfejs pozwalający zdubbingować surowe wideo prosto z pliku napisów wciąż jest opisany jako będący w budowie.

#movie dubbing#lip sync#voice cloning#open weights#research licence
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję