Skip to main content
QUICK REVIEW

[论文解读] STPOTR: Simultaneous Human Trajectory and Pose Prediction Using a Non-Autoregressive Transformer for Robot Following Ahead

Mohammad Mahdavian, Payam Nikdel|arXiv (Cornell University)|Sep 15, 2022
Human Pose and Action Recognition被引用 4
一句话总结

本文提出 STPOTR,一种非自回归 Transformer 模型,可联合预测人类 3D 轨迹与全身姿态,用于机器人跟随之类任务。通过双编码器与解码器的共享表征学习,结合多头注意力机制,该模型实现了快速、精确的预测,使机器人在复杂动作(如起坐转换)下仍能稳健跟随,其速度与对多样化人类行为的泛化能力优于先前方法。

ABSTRACT

In this paper, we develop a neural network model to predict future human motion from an observed human motion history. We propose a non-autoregressive transformer architecture to leverage its parallel nature for easier training and fast, accurate predictions at test time. The proposed architecture divides human motion prediction into two parts: 1) the human trajectory, which is the hip joint 3D position over time and 2) the human pose which is the all other joints 3D positions over time with respect to a fixed hip joint. We propose to make the two predictions simultaneously, as the shared representation can improve the model performance. Therefore, the model consists of two sets of encoders and decoders. First, a multi-head attention module applied to encoder outputs improves human trajectory. Second, another multi-head self-attention module applied to encoder outputs concatenated with decoder outputs facilitates learning of temporal dependencies. Our model is well-suited for robotic applications in terms of test accuracy and speed, and compares favorably with respect to state-of-the-art methods. We demonstrate the real-world applicability of our work via the Robot Follow-Ahead task, a challenging yet practical case study for our proposed model.

研究动机与目标

  • 为解决机器人跟随后行任务的挑战,该任务相较于从后方或侧面跟随更为复杂,因其需要预测人类意图。
  • 通过引入人体姿态信息,提升机器人跟随性能,因为姿态能传递轨迹之外的关键运动意图。
  • 开发一种快速、精确且适用于机器人部署的实时推理模型,克服自回归模型的局限性。
  • 通过单一统一的运动预测模型,实现对多种跟随行为(如并行跟随、可变距离跟随)的泛化控制策略。
  • 通过 3D 人体姿态估计流程与 TurtleBot2 平台,验证该方法在真实场景中的适用性。

提出的方法

  • 模型采用两个并行的非自回归 Transformer:一个用于预测髋关节轨迹,另一个用于预测相对于髋关节的全身姿态。
  • 在编码器输出上应用多头自注意力模块,通过关注相关空间与时间特征,提升轨迹预测性能。
  • 另一个多头自注意力模块处理编码器与解码器输出的拼接结果,以建模轨迹与姿态中的长程时间依赖关系。
  • 模型在观测到的人体运动序列上端到端训练,未来运动并行预测,避免暴露偏差并减少推理时间。
  • 使用 ZED2 相机与 3D 姿态估计实现实时人体运动估计,将最后 5 帧(0.5 秒)输入 STPOTR,以预测未来 20 帧(2 秒)。
  • 机器人目标位置设定为第 20 帧预测人体姿态前方 1.5 米处,由时间弹性带(TEB)规划器确保安全导航。

实验结果

研究问题

  • RQ1非自回归 Transformer 架构是否能在速度与精度上实现对自回归模型的超越,完成人类轨迹与 3D 姿态的联合预测?
  • RQ2通过共享表征学习,同时预测轨迹与姿态是否能提升整体性能?
  • RQ3该模型是否能在包含非直线运动(如起坐转换)的复杂真实场景中实现鲁棒的机器人跟随后行?
  • RQ4该模型是否能无需微调即可泛化至多种机器人跟随行为(如并行跟随、可变距离跟随)?
  • RQ5在使用噪声较大的真实 3D 姿态估计(如 ZED2)时,该模型相较于依赖动作捕捉的方法表现如何?

主要发现

  • 在 S 形与 U 形轨迹中,该模型在平均奖励上显著优于手工设计与强化学习基线方法,表明其在复杂运动预测中具备更优性能。
  • 即使在起坐与坐立转换过程中,该模型仍成功实现机器人跟随后行,而仅依赖轨迹的模型则难以应对此类挑战。
  • 该系统在无需重新训练的情况下即可泛化至并行跟随与可变距离跟随,而强化学习基线方法 LBGP 则需为每种行为单独微调。
  • 当机器人初始位于人体左侧进行 U 形运动时,性能表现较差,可能由于初始距离与遮挡效应所致。
  • 使用噪声较大的 ZED2 3D 姿态估计并未显著降低性能,表明模型对真实世界传感器噪声具有鲁棒性。
  • 消融实验证实,联合预测与共享注意力模块均提升了性能,验证了模型设计的合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。