[论文解读] MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video Generation
该论文提出了MM-Diffusion,这是首个采用耦合去噪U-Net与新颖的随机偏移交叉注意力机制的联合音频-视频生成框架,以实现音频与视频生成的同步。该方法在Landscape和AIST++数据集上达到最先进性能,FVD降低56.7%,FAD降低37.7%,并在图灵测试中表现出强劲的人类偏好,84.9%的样本与真实数据无法区分。
We propose the first joint audio-video generation framework that brings engaging watching and listening experiences simultaneously, towards high-quality realistic videos. To generate joint audio-video pairs, we propose a novel Multi-Modal Diffusion model (i.e., MM-Diffusion), with two-coupled denoising autoencoders. In contrast to existing single-modal diffusion models, MM-Diffusion consists of a sequential multi-modal U-Net for a joint denoising process by design. Two subnets for audio and video learn to gradually generate aligned audio-video pairs from Gaussian noises. To ensure semantic consistency across modalities, we propose a novel random-shift based attention block bridging over the two subnets, which enables efficient cross-modal alignment, and thus reinforces the audio-video fidelity for each other. Extensive experiments show superior results in unconditional audio-video generation, and zero-shot conditional tasks (e.g., video-to-audio). In particular, we achieve the best FVD and FAD on Landscape and AIST++ dancing datasets. Turing tests of 10k votes further demonstrate dominant preferences for our model. The code and pre-trained models can be downloaded at https://github.com/researchmm/MM-Diffusion.
研究动机与目标
- 为解决扩散模型中缺乏联合音频-视频生成的问题,实现同步、高保真内容生成。
- 设计一种多模态扩散框架,以学习音频与视频模态之间的联合分布。
- 通过高效的跨模态注意力机制,确保音频与视频在语义和时间上的对齐。
- 实现零样本条件生成,无需特定任务微调。
- 通过客观指标与人类评估验证模型的逼真度与感知质量。
提出的方法
- MM-Diffusion采用两个耦合的去噪自编码器,分别处理音频与视频,共享反向去噪过程。
- 通过顺序多模态U-Net架构,基于前一ored的去噪输出,将每个模态的去噪过程条件化于另一模态的输出。
- 新颖的基于随机偏移的交叉注意力模块,通过关注相对于视频帧随机偏移的音频片段,实现高效的跨模态交互。
- 该注意力机制减少了时间冗余,并在每个时间步增强了音频与视频之间的语义对齐。
- 通过重加权目标函数进行训练,以优化两个模态的去噪性能。
- 通过梯度引导或替换式提示实现零样本条件生成,无需微调。

实验结果
研究问题
- RQ1扩散模型能否在保持强跨模态对齐的前提下,联合生成高保真音频与视频?
- RQ2如何设计跨模态注意力机制,以在不引入过高计算成本的前提下高效对齐音频与视频?
- RQ3与独立模型相比,联合学习在多大程度上能提升单模态生成质量?
- RQ4该模型能否在无需微调的情况下泛化至零样本条件生成任务(如视频到音频或音频到视频)?
- RQ5在人类感知中,生成的音频-视频对有多逼真?其表现如何通过图灵测试衡量?
主要发现
- 在Landscape数据集上,MM-Diffusion相较于最先进单模态模型,FVD提升25.0%,FAD提升32.9%。
- 在AIST++数据集上,与先前最先进模型相比,FVD降低56.7%,FAD降低37.7%。
- 图灵测试显示,Landscape数据集生成的84.9%音频-视频对与真实数据无法区分。
- 在零样本条件生成中,梯度引导方法生成的结果在时间与语义对齐性上优于替换方法。
- 消融实验表明,多模态注意力中更大的窗口尺寸可提升性能,其中[8,8,8]配置取得最优FVD与FAD得分。
- 随机偏移注意力机制显著增强了跨模态对齐,与基线相比使FVD降低42.5%。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。