Skip to main content
QUICK REVIEW

[論文レビュー] STPOTR: Simultaneous Human Trajectory and Pose Prediction Using a Non-Autoregressive Transformer for Robot Following Ahead

Mohammad Mahdavian, Payam Nikdel|arXiv (Cornell University)|Sep 15, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、ロボットのフォローアヘッドタスクにおける人間の3次元軌道とボディポーズを同時に予測する非自己回帰的Transformerモデル、STPOTRを提案する。二重エンコーダーとデコーダーを用いた共有表現を活用し、マルチヘッドアテンションにより、高速かつ高精度な予測を実現し、スイッチトゥスタンドなどの複雑な動きに対しても、実世界でのロボットフォローアヘッドを安定化させる。従来手法に比べて速度と多様な人間行動への一般化性能に優れる。

ABSTRACT

In this paper, we develop a neural network model to predict future human motion from an observed human motion history. We propose a non-autoregressive transformer architecture to leverage its parallel nature for easier training and fast, accurate predictions at test time. The proposed architecture divides human motion prediction into two parts: 1) the human trajectory, which is the hip joint 3D position over time and 2) the human pose which is the all other joints 3D positions over time with respect to a fixed hip joint. We propose to make the two predictions simultaneously, as the shared representation can improve the model performance. Therefore, the model consists of two sets of encoders and decoders. First, a multi-head attention module applied to encoder outputs improves human trajectory. Second, another multi-head self-attention module applied to encoder outputs concatenated with decoder outputs facilitates learning of temporal dependencies. Our model is well-suited for robotic applications in terms of test accuracy and speed, and compares favorably with respect to state-of-the-art methods. We demonstrate the real-world applicability of our work via the Robot Follow-Ahead task, a challenging yet practical case study for our proposed model.

研究の動機と目的

  • フォローアヘッドは、背後に付いていく場合や横に付いていく場合よりも、意図予測の必要があるため、より複雑であるという課題に対処する。
  • 人間の身体ポーズを組み込むことで、軌道のみに依存する場合よりも、重要な運動の意図を捉えることにより、ロボットフォローアシストを向上させる。
  • 自己回帰的モデルの制限を克服し、ロボットの実装に適した高速で高精度なリアルタイム対応が可能なモデルを開発する。
  • 1つの統合された運動予測モデルを用いて、複数のフォローアシスト行動(例:横並びフォロー、可変距離フォロー)を一般化可能な制御ポリシーを可能にする。
  • 3次元人間ポーズ推定パイプラインとTurtleBot2プラットフォームを用いて、実世界での適用可能性を実証する。

提案手法

  • モデルは、脚部関節の軌道を予測するための1つと、脚部関節を基準とした全身ポーズを予測するためのもう1つの平行な非自己回帰的Transformerを使用する。
  • トラジェクトリ予測の精度を向上させるために、エンコーダ出力にマルチヘッド自己アテンションモジュールを適用し、関連する空間的・時間的特徴に注目させる。
  • エンコーダ出力とデコーダ出力の連結出力を処理する別のマルチヘッドアテンションモジュールを用い、軌道とポーズの両方における長距離時間的依存性をモデル化する。
  • 観測された人間の運動シーケンス上でエンドツーエンドに学習され、将来の運動が並列に予測されるため、露出バイアスを回避し、推論時間を短縮する。
  • リアルタイムで人間の運動がZED2カメラと3次元ポーズ推定を用いて推定され、最後の5フレーム(0.5秒)がSTPOTRに供給され、将来20フレーム(2秒)を予測する。
  • ロボットのゴールは、20番目のフレームにおける予測された人間ポーズから1.5m前方に設定され、時間的弾性バンド(TEB)プランナが安全なナビゲーションを保証する。

実験結果

リサーチクエスチョン

  • RQ1非自己回帰的Transformerアーキテクチャは、自己回帰的モデルに比べて、人間の軌道と3次元ポーズの同時予測を高速かつ高精度に達成できるか?
  • RQ2軌道とポーズの同時予測は、共有表現学習により性能向上をもたらすか?
  • RQ3このようなモデルは、スイッチトゥスタンドなどの非直線的で複雑な人間の動きを含む実世界のシナリオにおいて、ロボットフォローアヘッドを安定化できるか?
  • RQ4再トレーニングなしで、複数のロボットフォローアシスト行動(例:横並びフォロー、可変距離フォロー)に一般化できるか?
  • RQ5モーションキャプチャに依存する手法と比較して、ノイズの多い実世界の3次元ポーズ推定環境下でも、本モデルの性能は劣化しないか?

主な発見

  • 本モデルは、S字型およびU字型の軌道において、ハンドクラフトおよび強化学習ベースのベースラインと比較して顕著に高い平均報酬を達成し、複雑な運動予測性能の優位性を示した。
  • 本モデルは、スイッチトゥスタンドやスタンドトゥサイトの遷移中でさえも、成功裏にロボットフォローアヘッドを実現した。これは、軌道のみのモデルが困難とする状況である。
  • 再トレーニングなしで、横並びフォローおよび可変距離フォローに一般化できた。これに対して、強化学習ベースのLBGP手法は、各バリエーションごとに再トレーニングが必要であった。
  • U字型運動中にロボットが人間の左側に初期位置をとった場合にのみ、性能が著しく低下した。これは初期距離および遮蔽効果によるものと推測される。
  • ZED2を用いたノイズの多い3次元ポーズ推定を用いても、性能の著しい低下は見られず、実世界のセンサーノイズに強く、ロバストであることが示された。
  • アブレーションスタディにより、同時予測と共有アテンションモジュールが性能向上に寄与していることが確認され、設計選択の妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。