[논문 리뷰] MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video Generation
이 논문은 새로운 랜덤 시프트 크로스 어텐션 메커니즘을 통해 결합된 노이즈 제거 U-Net을 사용하여 음성과 영상을 동시에 생성하는 MM-Diffusion를 소개한다. 이는 음성과 영상 생성을 동기화하는 최초의 통합 음성-영상 생성 프레임워크이다. Landscape 및 AIST++ 데이터셋에서 최신 기술 대비 FVD가 56.7% 낮고 FAD가 37.7% 낮은 성능을 달성하였으며, 튜링 테스트에서 84.9%의 샘플이 실제 데이터와 구분되지 않아 강한 인간 선호도를 보였다.
We propose the first joint audio-video generation framework that brings engaging watching and listening experiences simultaneously, towards high-quality realistic videos. To generate joint audio-video pairs, we propose a novel Multi-Modal Diffusion model (i.e., MM-Diffusion), with two-coupled denoising autoencoders. In contrast to existing single-modal diffusion models, MM-Diffusion consists of a sequential multi-modal U-Net for a joint denoising process by design. Two subnets for audio and video learn to gradually generate aligned audio-video pairs from Gaussian noises. To ensure semantic consistency across modalities, we propose a novel random-shift based attention block bridging over the two subnets, which enables efficient cross-modal alignment, and thus reinforces the audio-video fidelity for each other. Extensive experiments show superior results in unconditional audio-video generation, and zero-shot conditional tasks (e.g., video-to-audio). In particular, we achieve the best FVD and FAD on Landscape and AIST++ dancing datasets. Turing tests of 10k votes further demonstrate dominant preferences for our model. The code and pre-trained models can be downloaded at https://github.com/researchmm/MM-Diffusion.
연구 동기 및 목표
- 확산 모델에서 음성-영상 동시 생성의 부족을 해결하여 동기화되고 고해상도의 콘텐츠 생성을 가능하게 한다.
- 음성과 영상 모odal 간의 공동 분포를 학습하는 다중모달 확산 프레임워크를 설계한다.
- 효율적인 크로스모달 어텐션을 통해 음성과 영상 간의 의미적 및 시간적 정렬을 보장한다.
- 특정 작업용 미세조정 없이도 제로샷 조건부 생성을 가능하게 한다.
- 객관적 지표와 인간 평가를 통해 모델의 현실성과 지각적 품질을 검증한다.
제안 방법
- MM-Diffusion는 각각 음성과 영상을 별도로 처리하는 두 개의 결합된 노이즈 제거 오토인코더를 사용하며, 공유된 역방향 노이즈 제거 과정을 갖는다.
- 순차적인 다중모달 U-Net 아키텍처는 이전 단계에서의 다른 모달의 노이즈 제거 출력을 조건으로 하여 공동 노이즈 제거를 가능하게 한다.
- 새로운 랜덤 시프트 기반 크로스 어텐션 블록은 영상 프레임에 대해 음성 세그먼트를 무작위로 시프트한 상태에서 어텐션을 수행함으로써 효율적인 크로스모달 상호작용을 가능하게 한다.
- 이 어텐션 메커니즘은 시간적 부족함을 줄이고 각 타임스텝에서 음성과 영상 간의 의미적 정렬을 강화한다.
- 모델는 두 모달 모두에서 노이즈 제거 성능을 최적화하기 위해 재가중된 목적함수를 사용하여 훈련된다.
- 미세조정 없이도 기울기 유도 또는 대체 기반 프롬프팅을 통해 제로샷 조건부 생성이 가능하다.

실험 결과
연구 질문
- RQ1확산 모델이 강력한 크로스모달 정렬을 유지하면서 고해상도의 음성과 영상을 동시에 생성할 수 있는가?
- RQ2과도한 계산 비용 없이도 효율적으로 음성과 영상 간의 정렬을 도모할 수 있는 크로스모달 어텐션은 어떻게 설계할 수 있는가?
- RQ3통합 학습이 고립된 모델 대비 단일 모달 생성 품질을 얼마나 향상시킬 수 있는가?
- RQ4특정 작업용 미세조정 없이도 비디오-음성 또는 음성-비디오 등의 제로샷 조건부 생성 작업에 일반화할 수 있는가?
- RQ5튜링 테스트를 통해 인간의 지각에서 생성된 음성-영상 쌍은 얼마나 현실적인가?
주요 결과
- Landscape 데이터셋에서 MM-Diffusion는 최신 기술 대비 FVD가 25.0% 향상되고 FAD가 32.9% 향상되었다.
- AIST++ 데이터셋에서 모델는 이전 최신 기술 대비 FVD를 56.7% 감소시키고 FAD를 37.7% 감소시켰다.
- 튜링 테스트 결과, Landscape 데이터셋에서 생성된 음성-영상 쌍 중 84.9%가 실제 데이터와 구분되지 않았다.
- 제로샷 조건부 생성에서 기울기 유도 방법이 대체 방법보다 더 높은 시간적 및 의미적 정렬을 보였다.
- 절단 실험 결과, 다중모달 어텐션에서 더 큰 윈도우 크기가 성능 향상에 기여하며, [8,8,8] 설정에서 FVD와 FAD 점수가 가장 우수했다.
- 랜덤 시프트 어텐션 메커니즘은 크로스모달 정렬을 크게 향상시켜, 이와 같은 메커니즘이 없는 기준 모델 대비 FVD를 42.5% 감소시켰다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.