PrismAudio
Alibaba Cloud · China · 2026
Model tworzący dźwięk do obrazu z laboratorium FunAudioLLM Alibaby: ogląda nieme nagranie i układa do niego ścieżkę dźwiękową. Planowanie rozbija na cztery osobne tory rozumowania — znaczenie, czas, estetykę i przestrzeń — każdy uczony na własnej nagrodzie.
PrismAudio tworzy ścieżkę dźwiękową do niemego obrazu: kroki, drzwi, deszcz, tło pomieszczenia — całą tę warstwę, którą ekipa filmowa nagrywa albo składa ręcznie. Pochodzi z tego samego zespołu Alibaby co ThinkSound, który wprowadził do tego zadania rozumowanie krok po kroku, i został przyjęty na główną konferencję ICLR 2026. Jego wkład polega na tym, że przestaje traktować to rozumowanie jak jedną rzecz. Tam, gdzie ThinkSound planował dźwięk w jednym łańcuchu myśli, PrismAudio prowadzi cztery: tor znaczenia rozstrzyga, co wydaje dźwięk, tor czasu — kiedy to następuje, tor estetyczny — jak to ma brzmieć, a tor przestrzenny — gdzie w polu stereo ma się znaleźć. Każdy ma własną funkcję nagrody, a model jest dostrajany uczeniem ze wzmocnieniem wobec wszystkich czterech naraz; producent określa go jako pierwszy system dźwięku do obrazu trenowany w ten sposób. Rozdzielenie ma sens, bo te cele ciągną w różne strony: dźwięk trafiony co do klatki bywa niewłaściwym dźwiękiem, a piękny dźwięk bywa spóźniony. Model nie stoi na własnych fundamentach. Jako szkielety zadeklarowano dwa modele Google — enkoder obrazu VideoPrism-large i enkoder tekstu T5Gemma — więc jest to badawczy artefakt Alibaby zbudowany na częściach konkurenta. Do pobrania jest 5,75 GiB w trzech kawałkach: sam generator, autoenkoder dźwięku i moduł synchronizacji przejęty z wydania ThinkSounda. Producent nie podaje liczby parametrów, a wagi rozprowadza w plikach .ckpt PyTorcha, a nie w bezpieczniejszym formacie safetensors. Osobnej uwagi wymaga licencja. Repozytorium jest oznaczone jako MIT, co normalnie pozwala na użytek komercyjny bez pytania. Karta modelu stwierdza następnie, że kod, wagi i zbiory danych służą wyłącznie badaniom i nauce, a użytek komercyjny wymaga wyraźnej zgody autorów. Kto przeczyta samą etykietę, wyciągnie błędny wniosek. Repozytorium ma 82 gwiazdki i zero odnotowanych pobrań, ale tego licznika nie należy czytać jako braku zainteresowania: Hugging Face rejestruje wyłącznie standardowe pliki modeli, a to wydanie składa się z checkpointów PyTorcha. Konkurencyjne repozytorium MMAudio pokazuje zero dokładnie tak samo.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!