[论文解读] Generating Smooth Pose Sequences for Diverse Human Motion Prediction
本文提出了一种统一的深度生成模型,用于多样化且可控的人体动作预测,通过归一化流建模姿态先验,并利用关节角约束实现时间上的平滑性。该方法按顺序生成身体各部分,支持端到端训练,在多样性和准确性方面均优于当前最先进基线模型,其中样本多样性提高25%,在Human3.6M数据集上重建误差降低8%。
Recent progress in stochastic motion prediction, i.e., predicting multiple possible future human motions given a single past pose sequence, has led to producing truly diverse future motions and even providing control over the motion of some body parts. However, to achieve this, the state-of-the-art method requires learning several mappings for diversity and a dedicated model for controllable motion prediction. In this paper, we introduce a unified deep generative network for both diverse and controllable motion prediction. To this end, we leverage the intuition that realistic human motions consist of smooth sequences of valid poses, and that, given limited data, learning a pose prior is much more tractable than a motion one. We therefore design a generator that predicts the motion of different body parts sequentially, and introduce a normalizing flow based pose prior, together with a joint angle loss, to achieve motion realism.Our experiments on two standard benchmark datasets, Human3.6M and HumanEva-I, demonstrate that our approach outperforms the state-of-the-art baselines in terms of both sample diversity and accuracy. The code is available at https://github.com/wei-mao-2019/gsps
研究动机与目标
- 解决现有随机动作预测方法在实现多样性和可控性时需要多次映射或独立模型的局限性。
- 通过学习姿态级先验而非动作级分布,克服基于VAE方法中的模式崩溃问题。
- 利用单一、可端到端训练的模型,实现多样化和可控动作的联合预测。
- 通过姿态先验和关节角损失,强制施加运动学约束和时间一致性,确保生成动作序列的真实感和平滑性。
- 提供统一解决方案,支持无需模型微调的非可控多样化生成与基于部位的可控生成。
提出的方法
- 提出一种基于归一化流的姿态先验,用于建模有效人体姿态的分布,实现精确对数似然计算并提升多样性。
- 引入一种顺序生成器,按顺序解码不同身体部位(如先下肢,后上肢)的动作,以实现基于部位的控制。
- 通过惩罚不自然关节构型的关节角损失,强制实现时间平滑性和运动学真实性。
- 在训练过程中显式最大化预测姿态对之间的距离,以提升样本间多样性。
- 采用条件潜在空间设定,固定某些身体部位(如下肢)的潜在码,同时改变其他部位(如上肢)的潜在码,以实现可控生成。
- 使用包含重建损失、多样性损失、姿态先验损失和关节角损失的复合损失函数,对整个模型进行端到端训练。
实验结果
研究问题
- RQ1统一的深度生成模型是否能在不为每种模式单独训练的情况下,同时实现多样化和可控的人体动作预测?
- RQ2通过归一化流建模姿态先验,是否能生成比直接学习动作分布更真实、更多样化的动作序列?
- RQ3身体部位的顺序生成是否能实现在保持动作真实性和多样性的前提下,对特定身体部位进行精确控制?
- RQ4在标准基准上,该方法在多样性(APD)和准确性(ADE、FDE)方面与最先进方法相比表现如何?
- RQ5缺乏姿态先验在多大程度上会导致生成动作序列中出现不真实或无效的姿态?
主要发现
- 在Human3.6M数据集上,所提方法相比最先进方法DLow,ADE(重建误差)降低8%,APD(平均成对多样性)提高25%。
- 该模型在所有指标(包括ADE、FDE、MMADE、MMFDE和APD)上均优于Human3.6M和HumanEva-I数据集上的所有基线模型。
- 定性结果表明,与DLow相比,该模型生成的动作更真实、更多样化;DLow偶尔会产生无效姿态(如图7中红框所示)。
- 消融实验表明,若移除姿态先验损失(L_nf),姿态质量(NLL)会急剧下降,即使多样性提高,也说明姿态先验的必要性。
- 该方法能成功在多样化上肢预测中保持一致的下肢动作,而DLow无法在不使用拒绝采样的情况下保证此控制,后者会降低上肢多样性。
- 该方法可推广至其他生成器,如将条件设定适配到BoM,进一步验证了其设计的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。