[论文解读] Modiff: Action-Conditioned 3D Motion Generation with Denoising Diffusion Probabilistic Models
Modiff 提出了一种去噪扩散概率模型(DDPM),用于条件化3D动作生成,以动作类别作为输入,生成多样化且逼真的骨骼序列。该方法在 NTU RGB+D 数据集上达到最先进性能,相比 Kinetic-GAN⋆ 的 FMD 降低了 64.49,且在多样性与真实感方面优于先前方法。
Diffusion-based generative models have recently emerged as powerful solutions for high-quality synthesis in multiple domains. Leveraging the bidirectional Markov chains, diffusion probabilistic models generate samples by inferring the reversed Markov chain based on the learned distribution mapping at the forward diffusion process. In this work, we propose Modiff, a conditional paradigm that benefits from the denoising diffusion probabilistic model (DDPM) to tackle the problem of realistic and diverse action-conditioned 3D skeleton-based motion generation. We are a pioneering attempt that uses DDPM to synthesize a variable number of motion sequences conditioned on a categorical action. We evaluate our approach on the large-scale NTU RGB+D dataset and show improvements over state-of-the-art motion generation methods.
研究动机与目标
- 为解决基于动作类型生成多样化、逼真且可控的3D人体动作序列的挑战。
- 探索去噪扩散概率模型在基于骨骼的动作生成领域中的潜力,该领域此前对此类方法的研究较为不足。
- 通过利用 DDPM 的去噪过程,改进现有生成模型在动作合成中的表现,以提升生成样本的质量与多样性。
- 通过条件化反向马尔可夫链实现具有一致动作语义的可变长度动作序列生成。
- 在大规模数据集上,基于扩散模型建立动作条件化3D动作生成的新最先进基线。
提出的方法
- Modiff 采用去噪扩散概率模型(DDPM)学习一个前向加噪过程,逐步向3D骨骼序列添加高斯噪声。
- 反向过程通过条件于动作类别的 U-Net 架构逐步去噪,利用类别条件嵌入实现条件控制。
- 在训练和推理过程中,将3D骨骼序列视为2D时空特征图,以利用卷积操作的优势。
- 模型采用带有跳跃连接的条件化 U-Net,以在去噪过程中保持时空一致性。
- 使用 L1 和 L2 损失函数联合监督去噪过程,消融实验表明 L1 损失可获得更优的 FMD 分数。
- 动作标签通过基于 Ho 等人 [34] 方法的可学习嵌入层进行嵌入,相比先前的标签嵌入技术,性能更优。
实验结果
研究问题
- RQ1去噪扩散模型能否有效生成基于动作类别的多样化且逼真的3D人体动作序列?
- RQ2损失函数选择(L1 与 L2)如何影响生成动作序列的质量与多样性?
- RQ3不同 U-Net 架构(如深度与宽度)对动作生成性能有何影响?
- RQ4标签嵌入策略如何影响模型在不同动作类别间的泛化能力?
- RQ5扩散模型能否在动作条件化3D动作生成任务中超越现有的 GAN 和 VAE 方法?
主要发现
- Modiff 在 NTU RGB+D 数据集上取得 FMD 得分为 9.42 ± 0.00,显著优于 Kinetic-GAN⋆(FMD = 73.91)和 Kinetic-GAN-MLP8(FMD = 82.88)。
- 消融实验表明,使用 L1 损失相比 L2 损失可使 FMD 降低 6.28,表明重建保真度更优。
- 将 U-Net 的潜在通道数从 16 增加到 64,使 FMD 降低 145.74,证明了高表达能力潜在表征的重要性。
- 基于 Ho 等人 [34] 的标签嵌入方法相比 [29] 中的方法使 FMD 提升 0.3,证实其在条件建模中的有效性。
- 定性结果表明,Modiff 生成的动作序列具有稳定的节奏、逼真的关节动力学以及清晰的动作语义,如“敬礼”和“双手交叉于胸前”。
- 尽管性能有所提升,部分样本仍存在抖动或提前/延迟崩溃现象,表明在时间稳定性方面仍有优化空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。