MDL-9013EST.2026 · IDX.984
AudioPrototyp

PrismAudio

Alibaba Cloud · China · 2026

Model tworzący dźwięk do obrazu z laboratorium FunAudioLLM Alibaby: ogląda nieme nagranie i układa do niego ścieżkę dźwiękową. Planowanie rozbija na cztery osobne tory rozumowania — znaczenie, czas, estetykę i przestrzeń — każdy uczony na własnej nagrodzie.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

PrismAudio tworzy ścieżkę dźwiękową do niemego obrazu: kroki, drzwi, deszcz, tło pomieszczenia — całą tę warstwę, którą ekipa filmowa nagrywa albo składa ręcznie. Pochodzi z tego samego zespołu Alibaby co ThinkSound, który wprowadził do tego zadania rozumowanie krok po kroku, i został przyjęty na główną konferencję ICLR 2026. Jego wkład polega na tym, że przestaje traktować to rozumowanie jak jedną rzecz. Tam, gdzie ThinkSound planował dźwięk w jednym łańcuchu myśli, PrismAudio prowadzi cztery: tor znaczenia rozstrzyga, co wydaje dźwięk, tor czasu — kiedy to następuje, tor estetyczny — jak to ma brzmieć, a tor przestrzenny — gdzie w polu stereo ma się znaleźć. Każdy ma własną funkcję nagrody, a model jest dostrajany uczeniem ze wzmocnieniem wobec wszystkich czterech naraz; producent określa go jako pierwszy system dźwięku do obrazu trenowany w ten sposób. Rozdzielenie ma sens, bo te cele ciągną w różne strony: dźwięk trafiony co do klatki bywa niewłaściwym dźwiękiem, a piękny dźwięk bywa spóźniony. Model nie stoi na własnych fundamentach. Jako szkielety zadeklarowano dwa modele Google — enkoder obrazu VideoPrism-large i enkoder tekstu T5Gemma — więc jest to badawczy artefakt Alibaby zbudowany na częściach konkurenta. Do pobrania jest 5,75 GiB w trzech kawałkach: sam generator, autoenkoder dźwięku i moduł synchronizacji przejęty z wydania ThinkSounda. Producent nie podaje liczby parametrów, a wagi rozprowadza w plikach .ckpt PyTorcha, a nie w bezpieczniejszym formacie safetensors. Osobnej uwagi wymaga licencja. Repozytorium jest oznaczone jako MIT, co normalnie pozwala na użytek komercyjny bez pytania. Karta modelu stwierdza następnie, że kod, wagi i zbiory danych służą wyłącznie badaniom i nauce, a użytek komercyjny wymaga wyraźnej zgody autorów. Kto przeczyta samą etykietę, wyciągnie błędny wniosek. Repozytorium ma 82 gwiazdki i zero odnotowanych pobrań, ale tego licznika nie należy czytać jako braku zainteresowania: Hugging Face rejestruje wyłącznie standardowe pliki modeli, a to wydanie składa się z checkpointów PyTorcha. Konkurencyjne repozytorium MMAudio pokazuje zero dokładnie tak samo.

#video-to-audio#foley#sound design#reinforcement learning#research licence
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję