Skip to main content
QUICK REVIEW

[论文解读] MotionMixer: MLP-based 3D Human Body Pose Forecasting

Arij Bouazizi, Adrian Holzbock|arXiv (Cornell University)|Jul 1, 2022
Human Pose and Action Recognition被引用 4
一句话总结

MotionMixer 提出了一种仅基于多层感知机(MLPs)的新型3D人体姿态预测模型,通过时空混合机制捕捉关节间关系与时间动态。该模型在Human3.6M、AMASS 和 3DPW 数据集上达到最先进性能,参数量显著少于先前方法,在误差减少方面相比SOTA模型最高提升4%,同时仅使用了次优模型0.5%的参数量。

ABSTRACT

In this work, we present MotionMixer, an efficient 3D human body pose forecasting model based solely on multi-layer perceptrons (MLPs). MotionMixer learns the spatial-temporal 3D body pose dependencies by sequentially mixing both modalities. Given a stacked sequence of 3D body poses, a spatial-MLP extracts fine grained spatial dependencies of the body joints. The interaction of the body joints over time is then modelled by a temporal MLP. The spatial-temporal mixed features are finally aggregated and decoded to obtain the future motion. To calibrate the influence of each time step in the pose sequence, we make use of squeeze-and-excitation (SE) blocks. We evaluate our approach on Human3.6M, AMASS, and 3DPW datasets using the standard evaluation protocols. For all evaluations, we demonstrate state-of-the-art performance, while having a model with a smaller number of parameters. Our code is available at: https://github.com/MotionMLP/MotionMixer

研究动机与目标

  • 开发一种完全摒弃RNN、CNN或GCN依赖、仅使用MLPs的3D人体姿态预测模型。
  • 通过统一的MLP架构高效建模关节间的空间关系与时间运动动态。
  • 在保持或提升预测精度的同时,降低模型复杂度与计算成本。
  • 利用挤压-激励(squeeze-and-excitation)模块校准输入序列中每个时间步的重要性,以提升长期预测性能。
  • 在标准基准上实现最先进性能,且参数量极低。

提出的方法

  • 模型采用两阶段MLP架构:空间MLP在每个时间步处理关节坐标,以提取细粒度的空间依赖关系。
  • 时间MLP随后建模时间步之间的交互,以捕捉运动动态。
  • 通过共享的MLP混合机制,将空间与时间特征进行融合,实现对时空依赖关系的联合建模。
  • 应用挤压-激励(SE)模块以重新校准序列中每个时间步的影响,提升对关键姿态的关注度。
  • 模型处理堆叠的3D姿态序列,并通过最终的MLP头解码未来姿态。
  • 采用3D关节位置的均方误差损失,进行端到端训练。

实验结果

研究问题

  • RQ1纯MLP架构能否在3D人体姿态预测任务中超越现有的基于RNN、CNN与GCN的模型?
  • RQ2通过MLPs实现的时空混合在捕捉复杂人体运动动态方面效果如何?
  • RQ3挤压-激励模块通过重新校准时间注意力,在多大程度上提升了长期预测的准确性?
  • RQ4轻量级MLP模型能否在显著少于现有方法的参数量下实现SOTA性能?
  • RQ5该模型在Human3.6M、AMASS与3DPW等多样化动作与数据集上的泛化能力如何?

主要发现

  • MotionMixer在Human3.6M、AMASS与3DPW数据集上均达到最先进性能,相比先前SOTA模型平均3D误差降低3.5mm。
  • 在1000ms预测时延下,MotionMixer在Human3.6M数据集上实现71.6mm的平均3D误差,相比次优模型误差降低4%。
  • 模型仅使用30.2k参数与2.1M FLOPs即可预测25帧,误差为71.6mm,优于参数量为57.5k的模型3.8mm。
  • 若移除空间或时间混合机制,1000ms时误差分别增加4%与6%,证实联合建模的必要性。
  • 挤压-激励模块在所有预测时延下均使误差降低2mm,证明其在时间校准方面的有效性。
  • 采用姿态位移表示可带来5mm的性能增益,表明模型对未见主体与环境的泛化能力得到提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。