Skip to main content
QUICK REVIEW

[论文解读] Multi-level Motion Attention for Human Motion Prediction

Wei Mao, Miaomiao Liu|arXiv (Cornell University)|Jun 17, 2021
Human Pose and Action Recognition参考文献 5被引用 4
一句话总结

本文提出了一种用于人体动作预测的多层级运动注意力机制,通过在关节、身体部位和完整姿态三个层级上比较当前运动上下文与历史子序列,捕捉时间重复性。通过融合这些注意力类型并使用可学习图卷积网络,该方法在Human3.6M、AMASS和3DPW数据集上实现了最先进性能,有效利用长期运动模式,且无需循环结构或固定感受野。

ABSTRACT

Human motion prediction aims to forecast future human poses given a historical motion. Whether based on recurrent or feed-forward neural networks, existing learning based methods fail to model the observation that human motion tends to repeat itself, even for complex sports actions and cooking activities. Here, we introduce an attention based feed-forward network that explicitly leverages this observation. In particular, instead of modeling frame-wise attention via pose similarity, we propose to extract motion attention to capture the similarity between the current motion context and the historical motion sub-sequences. In this context, we study the use of different types of attention, computed at joint, body part, and full pose levels. Aggregating the relevant past motions and processing the result with a graph convolutional network allows us to effectively exploit motion patterns from the long-term history to predict the future poses. Our experiments on Human3.6M, AMASS and 3DPW validate the benefits of our approach for both periodical and non-periodical actions. Thanks to our attention model, it yields state-of-the-art results on all three datasets. Our code is available at https://github.com/wei-mao-2019/HisRepItself.

研究动机与目标

  • 解决基于RNN的模型在捕捉长期运动依赖关系时因误差累积和梯度消失导致的局限性。
  • 克服逐帧注意力机制无法捕捉运动方向且对无关动作间姿态相似性敏感的缺陷。
  • 通过子序列相似性,不仅建模周期性动作(如行走)中的运动重复性,也建模非周期性复杂活动(如烹饪)中的重复性。
  • 设计一种前馈架构,动态关注相关的历史运动模式,而无需依赖循环单元或固定时间卷积核。
  • 通过从多样化历史序列中学习运动模式,提升在未见数据集和更长预测时序上的泛化能力与性能。

提出的方法

  • 提出运动注意力机制,将当前运动上下文(近期帧序列)与历史运动子序列进行比较,而非与单帧比较。
  • 定义三种运动注意力层级:关节层级(单个关节)、身体部位层级(分组关节)和完整姿态层级(整个姿态),每种层级捕捉不同类型的运动重复性。
  • 使用离散余弦变换(DCT)以非递归、无卷积的方式编码时间信息,实现长程时间建模。
  • 应用可学习图卷积网络(GCN)建模关节间的空间关系,图结构通过端到端学习获得,而非使用固定的运动学树。
  • 通过可学习加权机制融合多层级的注意力输出,自适应选择与当前上下文最相关的运动模式。
  • 采用前馈方式训练模型,使用预测关节点位置和角度的均方误差损失,实现无需自回归生成的推理。

实验结果

研究问题

  • RQ1基于子序列相似性的运动注意力是否相比逐帧注意力能显著提升长期人体动作预测性能?
  • RQ2在关节、身体部位和完整姿态多个层级上建模运动重复性,是否能在多样化运动类型中带来更好的性能表现?
  • RQ3时间编码方式的选择(DCT vs. RNN或卷积)对预测准确率和泛化能力有何影响?
  • RQ4与使用预定义运动学树相比,学习GCN邻接矩阵在多大程度上能提升性能?
  • RQ5该模型是否能在无需微调的情况下泛化到未见数据集和更长预测时序?

主要发现

  • 所提方法在Human3.6M、AMASS和3DPW数据集上均达到最先进性能,优于所有先前SOTA方法,包括Mao等人(2019)提出的LTD方法。
  • 在Human3.6M数据集上,融合全部三个层级(关节、部位、姿态)的运动注意力在关节点位置预测中表现最佳,将1000ms预测时延下的平均误差降低高达33.5%。
  • 在关节点角度预测中,融合姿态与部位层级的运动注意力达到最低误差,其在序列中优于其他注意力类型的成功率达到31.1%。
  • 该模型在未见数据集上泛化能力出色,当在Human3.6M和AMASS上训练后,仍能在3DPW上保持强劲性能,无需微调。
  • 使用可学习GCN连接矩阵相比使用预定义运动学树,将3D误差降低高达30%,证明了端到端结构学习的重要性。
  • 消融实验表明,DCT时间编码与可学习GCN均至关重要:移除任一模块均导致性能显著下降,尤其在长时延预测中更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。