Skip to main content
QUICK REVIEW

[论文解读] Multi-Person Extreme Motion Prediction

W. Guo, Xiaoyu Bie|arXiv (Cornell University)|May 18, 2021
Human Pose and Action Recognition被引用 9
一句话总结

本文提出了一种用于两人交互动作的协同运动预测方法,引入了交叉交互注意力(XIA)模块,通过联合建模双方过去的3D姿态来提升未来运动的预测性能。在专业舞者表演极限林迪舞动作的新数据集ExPI上进行评估,该方法在短期预测中比最先进单人方法高出10–40%的准确率,在长期预测中高出5–30%,显著提升了复杂人类交互建模的性能。

ABSTRACT

Human motion prediction aims to forecast future poses given a sequence of past 3D skeletons. While this problem has recently received increasing attention, it has mostly been tackled for single humans in isolation. In this paper, we explore this problem when dealing with humans performing collaborative tasks, we seek to predict the future motion of two interacted persons given two sequences of their past skeletons. We propose a novel cross interaction attention mechanism that exploits historical information of both persons, and learns to predict cross dependencies between the two pose sequences. Since no dataset to train such interactive situations is available, we collected ExPI (Extreme Pose Interaction), a new lab-based person interaction dataset of professional dancers performing Lindy-hop dancing actions, which contains 115 sequences with 30K frames annotated with 3D body poses and shapes. We thoroughly evaluate our cross interaction network on ExPI and show that both in short- and long-term predictions, it consistently outperforms state-of-the-art methods for single-person motion prediction.

研究动机与目标

  • 为高度互动、协作性的场景(如舞蹈或团队运动)中的3D人体运动预测填补空白。
  • 开发一种联合建模两人交互运动动态的方法,而非将他们独立处理。
  • 收集并发布一个全新的大规模、高质量数据集(ExPI),包含专业舞者表演极限互动林迪舞动作的3D姿态与体型数据。
  • 建立一个具有明确训练/测试划分和评估协议的协同运动预测基准。
  • 证明建模跨人之间依赖关系可显著提升预测准确率,尤其在如脚部等高动态关节上表现更优。

提出的方法

  • 提出一种新颖的交叉交互注意力(XIA)模块,将多头注意力机制扩展至联合处理两个交互个体的历史3D姿态序列。
  • 通过分别从两个序列中提取的键、查询和值向量,实现两人之间的交叉注意力,从而动态建模人与人之间的依赖关系。
  • 将XIA模块集成到序列到序列的运动预测框架中,使其在每个时间步都通过引入跨人上下文信息来增强时序建模能力。
  • 采用联合损失函数进行端到端训练,同时最小化两人预测误差。
  • 在多种设置下评估该方法:通用动作划分、单个动作划分和未见动作划分,以测试泛化能力。
  • 消融研究对比了XIA与基线方法(如姿态拼接、拼接、独立模型),结果表明交叉注意力机制具有显著优势。

实验结果

研究问题

  • RQ1在运动序列中建模跨人依赖关系是否能显著提升交互场景下的3D人体运动预测性能?
  • RQ2在极端高速互动场景下,协同运动预测方法相较于单人基线方法的性能表现如何?
  • RQ3所提出的XIA模块在多人设置下是否能泛化到未见动作和不同类型交互?
  • RQ4XIA模块在如空中舞姿中高动态关节(如脚部)上的预测准确率提升程度如何?
  • RQ5在高度动态、交互性强的运动序列中,长期预测(500–1000 ms)下模型表现如何?

主要发现

  • 所提出的XIA模型在短期运动预测(≤500 ms)中,相比最先进单人方法,准确率提升10–40%。
  • 在长期预测(500–1000 ms)中,XIA模型相比单人基线方法,准确率提升5–30%。
  • XIA模块显著提升了对高动态关节的预测性能,尤其是舞伴的脚部,这些部位在空中林迪舞动作中常处于空中飞行状态。
  • 消融研究证实,通过XIA同时更新键和值向量的注意力机制性能最佳,优于无XIA或仅部分更新注意力的模型。
  • 在未见动作划分中,XIA模型保持了强大的泛化能力,在多数动作上优于基线模型,表明其对新型交互类型的鲁棒性。
  • 采用XIA训练的模型始终优于所有基线模型,包括使用独立个体专用模型的方法,证明了跨人建模在协同运动预测中的关键价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。