Skip to main content
QUICK REVIEW

[论文解读] Learning Variations in Human Motion via Mix-and-Match Perturbation

Mohammad Sadegh Aliakbarian, Fatemeh Sadat Saleh|arXiv (Cornell University)|Aug 2, 2019
Human Pose and Action Recognition参考文献 34被引用 7
一句话总结

本文提出了一种名为 Mix-and-Match Perturbations 的方法,通过在循环编码器-解码器网络中使用条件变分自编码器对隐藏状态进行随机扰动,以在人类动作预测中实现真正的多样性。通过在训练过程中随机选择并扰动隐藏状态的子集,模型被迫依赖噪声进行生成,从而产生高质量、多样化的未来姿态序列,在无需推理阶段提供动作类别知识的情况下,其在多样性和预测精度方面均优于当前最先进(SOTA)的随机方法。

ABSTRACT

Human motion prediction is a stochastic process: Given an observed sequence of poses, multiple future motions are plausible. Existing approaches to modeling this stochasticity typically combine a random noise vector with information about the previous poses. This combination, however, is done in a deterministic manner, which gives the network the flexibility to learn to ignore the random noise. In this paper, we introduce an approach to stochastically combine the root of variations with previous pose information, which forces the model to take the noise into account. We exploit this idea for motion prediction by incorporating it into a recurrent encoder-decoder network with a conditional variational autoencoder block that learns to exploit the perturbations. Our experiments demonstrate that our model yields high-quality pose sequences that are much more diverse than those from state-of-the-art stochastic motion prediction techniques.

研究动机与目标

  • 解决现有随机动作预测模型的局限性,即学习忽略随机噪声,导致生成序列多样性较低的问题。
  • 开发一种方法,通过使模型依赖噪声进行预测而非确定性条件,从而强制实现真正的随机性。
  • 在保持高生成质量的同时,提升未来动作预测的多样性,特别是在长期预测中表现更优。
  • 实现与动作无关的动作预测,即模型在训练或推理阶段均无需使用动作类别标签。
  • 引入一种新的评估指标,以定量衡量生成动作序列的质量与多样性。

提出的方法

  • 提出 Mix-and-Match Perturbations 方法,即在每次训练迭代中随机扰动隐藏状态的一个子集,而非将噪声确定性地与完整隐藏状态结合。
  • 将该扰动策略应用于条件变分自编码器(CVAE)框架中 RNN 解码器的隐藏状态,确保模型学会将噪声作为变化的根本来源。
  • 使用随机重参数化技巧,实现对扰动隐藏状态的反向传播,从而支持端到端训练。
  • 在解码器中引入残差连接,以建模动作速度而非绝对姿态,提升长期预测的稳定性。
  • 通过重建损失与 KL 散度的组合进行模型训练,多样性通过扰动机制实现,而非依赖复杂的网络架构。
  • 使用标准指标(如 MAE)和基于生成序列对之间成对距离的新多样性指标联合评估性能。

实验结果

研究问题

  • RQ1能否使随机动作预测模型真正利用随机噪声作为变化源,而非学习忽略它?
  • RQ2在训练过程中随机修改隐藏状态子集的扰动策略,是否能生成更丰富且更逼真的未来动作序列?
  • RQ3该方法是否能在无需训练或推理阶段动作类别监督的情况下,实现动作预测多样性的 SOTA 性能?
  • RQ4生成样本数量(K)如何影响预测质量与多样性之间的权衡?
  • RQ5新的定量指标是否能有效捕捉生成人类动作序列的质量与多样性?

主要发现

  • 所提出的 Mix-and-Match Perturbation 方法在生成动作序列的多样性方面显著优于当前最先进基线模型,表现为多样性随训练时间持续提升,而 LHP 和 RHP 等模型则出现多样性下降。
  • 该模型生成的运动序列质量高,其平均角度误差(MAE)与或优于无需对抗损失或动作类别信息的确定性 SOTA 方法。
  • 在比较 K 个生成动作中的最佳结果时,该模型在多样性方面优于随机基线模型(LHP、RHP、LPP),展现出更强的探索多种合理未来路径的能力。
  • 即使在 K = 50 时,该方法仍能保持高质量预测,且将 K 增加至 50 以上时性能提升微乎其微,表明 K = 50 已足够实现最优性能。
  • 消融实验表明,仅当扰动强度(α)超过 0.7 时,多样性才显著提升,但此类高值会降低动作质量,证实了多样性与真实感之间的权衡。
  • 人类评估与定量指标一致表明,该模型能生成多样、合理且逼真的动作序列,且多样性由噪声驱动,而非网络架构的副效应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。