ThinkSound
Alibaba Cloud · China · 2025
Model tworzący dźwięk do obrazu z laboratorium FunAudioLLM Alibaby i Uniwersytetu Zhejiang: ogląda nieme nagranie i pisze do niego ścieżkę dźwiękową, planując każdy dźwięk w zapisanym toku rozumowania. Przyjęty na główną konferencję NeurIPS 2025; jego następcą jest PrismAudio.
ThinkSound układa warstwę dźwiękową do niemego obrazu — kroki, drzwi, silniki, deszcz, tło pomieszczenia — czyli pracę, którą ekipa filmowa nagrywa w studiu efektów albo składa ręcznie. Pomysł polegał na tym, żeby przestać tworzyć tę warstwę w jednym ślepym kroku. Najpierw wielomodalny model językowy (dostrojona VideoLLaMA 2) wypisuje rozumowanie o tym, co jest na ekranie, kiedy się dzieje i jak powinno brzmieć, i dopiero potem model dźwiękowy realizuje ten plan. Zespół wprowadził to do zadania w czerwcu 2025, a publikacja została przyjęta na główną konferencję NeurIPS 2025. System działa w trzech etapach. Najpierw tworzy spójne tło dźwiękowe całego ujęcia; potem widz może kliknąć przedmiot w kadrze i kazać dopracować jego dźwięk osobno; na końcu wynik da się poprawić zwykłym poleceniem. Jeden model obsługuje tworzenie, dopracowanie i edycję. Opublikowane pomiary uzasadniają ten pomysł i zarazem pokazują jego granicę. Wobec MMAudio, najmocniejszego porównywalnego systemu, ThinkSound podaje lepszą odległość rozkładów (34,56 wobec 43,26) i wyższe oceny słuchaczy zarówno za jakość dźwięku, jak i za dopasowanie (4,02 i 4,18 wobec 3,84 i 3,97; oryginalne nagrania dostają 4,37 i 4,56). Jest też prawie trzy razy szybszy na ujęcie — 1,07 sekundy wobec 3,01 — mimo że jest większym modelem. Nie wygrywa za to w synchronizacji: jego błąd czasowy 0,46 jest odrobinę gorszy niż 0,44 u MMAudio, więc rozumowanie kupuje zrozumienie sceny, a nie precyzję. Wyłączenie rozumowania kosztuje 13 procent wyniku jakości i oszczędza zaledwie 0,09 sekundy. Generator to wielostrumieniowy transformer dyfuzyjny o 1,3 miliarda parametrów i głębokości 21 warstw — 14 z nich trzyma osobne wagi dla każdej modalności, 7 jest wspólnych. Publikacja opisuje też konfiguracje średnią (724 mln) i małą (533 mln), których nie wydano. Opublikowana jest ta duża: plik 21,06 GB, dołożona tydzień później wersja odchudzona 5,73 GB oraz autoenkoder dźwięku 2,52 GB i moduł synchronizacji 950 MB. Licencję trzeba przeczytać dwa razy, bo etykieta kłóci się z treścią. Hugging Face oznacza repozytorium jako Apache 2.0 i faktycznie leży w nim pełny tekst tej licencji — ale adnotacja na końcu tego samego pliku oraz README projektu zgodnie stwierdzają, że kod, modele i zbiór danych służą wyłącznie badaniom i nauce, a użytek komercyjny jest niedozwolony. Autoenkoder dźwięku to dostrojony Stable Audio Open firmy Stability AI i pozostaje pod jej licencją społecznościową, która zakazuje rozprowadzania na jakiejkolwiek innej. Ponieważ bez tego składnika nic nie zamieni się w dźwięk, ograniczenie obejmuje działający system, a nie odłączalną część. Hugging Face nie odnotowuje dla tego repozytorium żadnych pobrań, ale tej liczby nie należy tu czytać: licznik rejestruje tylko standardowe pliki modeli, a to wydanie składa się z checkpointów PyTorcha. Repozytorium MMAudio pokazuje zero dokładnie z tego samego powodu. Projekt na GitHubie ma ponad 1300 gwiazdek i integracje innych autorów, w tym nakładkę do ComfyUI.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!