[论文解读] Motion-Conditioned Diffusion Model for Controllable Video Synthesis
MCDiff 提出了一种两阶段运动条件扩散模型,用于高保真、可控制的视频生成。该方法利用参考图像和稀疏笔画输入,分别引导前景物体运动与相机动态。首先,通过语义感知的光流补全网络将稀疏笔画补全为密集光流;随后,利用扩散模型生成高质量的未来帧。MCDiff 在多种人类活动和运动类型下,实现了笔画引导视频生成的最先进视觉质量。
Recent advancements in diffusion models have greatly improved the quality and diversity of synthesized content. To harness the expressive power of diffusion models, researchers have explored various controllable mechanisms that allow users to intuitively guide the content synthesis process. Although the latest efforts have primarily focused on video synthesis, there has been a lack of effective methods for controlling and describing desired content and motion. In response to this gap, we introduce MCDiff, a conditional diffusion model that generates a video from a starting image frame and a set of strokes, which allow users to specify the intended content and dynamics for synthesis. To tackle the ambiguity of sparse motion inputs and achieve better synthesis quality, MCDiff first utilizes a flow completion model to predict the dense video motion based on the semantic understanding of the video frame and the sparse motion control. Then, the diffusion model synthesizes high-quality future frames to form the output video. We qualitatively and quantitatively show that MCDiff achieves the state-the-of-art visual quality in stroke-guided controllable video synthesis. Additional experiments on MPII Human Pose further exhibit the capability of our model on diverse content and motion synthesis.
研究动机与目标
- 为解决基于扩散模型的视频生成中缺乏细粒度、直观控制的问题,特别是对内容和运动的联合指定。
- 克服在端到端扩散视频生成中,稀疏运动输入(如单像素笔画)带来的模糊性和困难。
- 实现在合成视频中对物体级运动和相机动态(如变焦、平移)的灵活控制。
- 通过两阶段框架提升笔画引导视频生成的视觉保真度与运动连贯性。
- 在 MPII Human Pose 等多样化、复杂的人体动作数据集上评估泛化能力。
提出的方法
- 采用两阶段框架:首先,光流补全模型(F)从稀疏笔画和初始视频帧中预测密集光流,利用语义上下文信息。
- 光流补全模型采用 U-Net 架构,并引入交叉注意力机制,将稀疏笔画与图像帧的语义特征对齐。
- 其次,条件扩散模型(G)利用初始帧和预测的密集光流作为条件输入,生成未来视频帧。
- 整个系统端到端微调,以确保光流补全与帧生成之间的协同优化。
- 扩散模型采用潜在扩散架构,并引入时间编码以建模时序动态。
- 模型在三个大规模数据集(包括 MPII Human Pose)上进行训练与评估,以衡量泛化能力与控制保真度。
实验结果
研究问题
- RQ1在稀疏运动输入模糊的条件下,两阶段扩散模型是否能优于单阶段端到端学习的视频生成性能?
- RQ2光流补全模型能否有效从稀疏笔画中推断出与输入帧语义一致的密集运动场?
- RQ3模型是否能从笔画输入中学习区分前景物体运动与背景相机运动?
- RQ4该框架是否能泛化到多样化的日常活动与复杂运动模式,而不仅限于简单数据集?
- RQ5与直接从稀疏笔画进行扩散生成相比,引入光流补全是否能显著提升视觉质量与运动连贯性?
主要发现
- MCDiff 在 TaiChi-HD 和 Human3.6M 等标准基准上实现了最先进视觉质量,其在定性和定量评估中均优于先前的笔画引导方法。
- 消融实验表明,采用光流补全的两阶段设计显著优于直接的单阶段训练,证明了解决运动模糊性的必要性。
- 光流补全模型成功推断出复杂运动的连贯密集光流,包括物体交互(如手抓衣物)和多物体运动。
- 模型能够将前景上的笔画解释为物体运动,将背景上的笔画解释为相机调整,从而生成逼真的相机轨迹。
- 在 MPII Human Pose 数据集上,MCDiff 在多种相机设置和场景条件下,对超过 400 种多样的人类活动均表现出良好的泛化能力。
- 模型在处理分布外编辑(如超出训练分布的物体运动)时存在局限,且在无纹理或视觉错觉场景中失效,原因在于其依赖基于模式的光流估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。