[论文解读] MoFusion: A Framework for Denoising-Diffusion-based Motion Synthesis
MoFusion 首次提出一种基于去噪扩散的框架,用于条件化 3D 人体动作生成,能够从文本和音频条件生成高质量、多样化且时间上连贯的动作。通过引入随时间变化的损失加权策略以整合运动学约束,该方法在文本到动作和音乐到编舞任务中均实现了最先进的性能,显著提升了真实感与语义准确性。
Conventional methods for human motion synthesis are either deterministic or struggle with the trade-off between motion diversity and motion quality. In response to these limitations, we introduce MoFusion, i.e., a new denoising-diffusion-based framework for high-quality conditional human motion synthesis that can generate long, temporally plausible, and semantically accurate motions based on a range of conditioning contexts (such as music and text). We also present ways to introduce well-known kinematic losses for motion plausibility within the motion diffusion framework through our scheduled weighting strategy. The learned latent space can be used for several interactive motion editing applications -- like inbetweening, seed conditioning, and text-based editing -- thus, providing crucial abilities for virtual character animation and robotics. Through comprehensive quantitative evaluations and a perceptual user study, we demonstrate the effectiveness of MoFusion compared to the state of the art on established benchmarks in the literature. We urge the reader to watch our supplementary video and visit https://vcai.mpi-inf.mpg.de/projects/MoFusion.
研究动机与目标
- 解决条件化 3D 人体动作生成中动作多样性与质量之间的权衡问题。
- 克服先前方法的局限性,例如 GAN 中的模式崩溃以及 VAE 中潜在空间的权衡问题。
- 实现从多样化输入(如文本和音乐)条件化生成长序列、时间连贯且语义对齐的动作。
- 引入交互式编辑功能,如插值生成与种子条件预测,适用于虚拟动画与机器人技术。
- 提升模型在训练分布之外的泛化能力,尤其针对未见音乐输入的编舞任务。
提出的方法
- 采用去噪扩散概率模型(DDPM)实现非自回归的 3D 动作生成,使用轻量级 1D U-Net 实现高效的反向去噪过程。
- 引入随时间变化的损失加权调度策略,在训练过程中动态平衡多种运动学损失,提升动作的合理性与时间连贯性。
- 通过交叉注意力机制将文本或音频嵌入作为条件输入,实现多模态控制的动作生成。
- 采用掩码去噪过程,在预测与插值任务中保留种子序列,确保结构一致性。
- 利用学习得到的潜在空间表示动作,相比基于码本的方法,实现更丰富的采样多样性与更强的抗动作闪烁能力。
- 应用逐步去噪的噪声调度策略,从随机噪声开始,由条件信号与运动学约束引导,逐步恢复出完整动作序列。
实验结果
研究问题
- RQ1去噪扩散模型能否被有效适配于长序列条件化 3D 人体动作生成?
- RQ2如何在不损害多样性或质量的前提下,将运动学合理性整合进扩散训练过程?
- RQ3MoFusion 能否泛化到训练分布之外的未见音乐或文本提示?
- RQ4与固定加权基线相比,所提出的随时间变化的损失加权策略在提升动作真实感与语义对齐方面有何优势?
- RQ5MoFusion 在多大程度上能够支持插值与种子条件预测等交互式编辑任务?
主要发现
- MoFusion 在 HumanML3D 与 AIST++ 基准测试中达到最先进性能,FID 为 8.82,FVD 为 2.521,优于先前方法(包括 T2M 与 MotionDiffuse)。
- 在用户研究中,MoFusion 在 51.4% 的比较中被认为比真实编舞更真实,在 52.3% 的案例中比 T2M 与 MotionDiffuse 更具语义准确性。
- 模型对未见音乐具有良好的泛化能力,即使在音乐超出训练分布的情况下,仍能生成非重复且节奏对齐的编舞。
- 得益于其大尺寸潜在空间与非自回归生成机制,MoFusion 避免了收敛至平均姿态的问题,并消除了动作闪烁现象。
- 通过掩码去噪机制,成功实现了种子条件预测与插值等交互式编辑任务,展示了在动画与机器人领域中的实际应用潜力。
- 随时间变化的损失加权策略显著提升了动作合理性,使时间连贯性与运动学准确性优于固定加权基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。