Skip to main content
QUICK REVIEW

[論文レビュー] 3DOF Pedestrian Trajectory Prediction Learned from Long-Term Autonomous Mobile Robot Deployment Data

Li Sun, Zhi Yan|arXiv (Cornell University)|Sep 30, 2017
Video Surveillance and Tracking Methods被引用数 5
ひとこと要約

本論文では、範囲計センサーを用いて2次元位置と方位を予測する、3DOF歩行者軌道予測モデルT-Pose-LSTMを提案する。長期間にわたる自律ロボット展開データを活用し、時系列的文脈(日付/時刻)をシーケンス・ツー・シーケンスLSTMエンコーダ・デコーダに組み込むことで、長期間予測において最先端の性能を達成し、15,000件の軌道を含む3か月間のケアホームデータセットにおいて、2Dベースラインと比較して平均位置ずれ誤差を10–20%低減した。

ABSTRACT

This paper presents a novel 3DOF pedestrian trajectory prediction approach for autonomous mobile service robots. While most previously reported methods are based on learning of 2D positions in monocular camera images, our approach uses range-finder sensors to learn and predict 3DOF pose trajectories (i.e. 2D position plus 1D rotation within the world coordinate system). Our approach, T-Pose-LSTM (Temporal 3DOF-Pose Long-Short-Term Memory), is trained using long-term data from real-world robot deployments and aims to learn context-dependent (environment- and time-specific) human activities. Our approach incorporates long-term temporal information (i.e. date and time) with short-term pose observations as input. A sequence-to-sequence LSTM encoder-decoder is trained, which encodes observations into LSTM and then decodes as predictions. For deployment, it can perform on-the-fly prediction in real-time. Instead of using manually annotated data, we rely on a robust human detection, tracking and SLAM system, providing us with examples in a global coordinate system. We validate the approach using more than 15K pedestrian trajectories recorded in a care home environment over a period of three months. The experiment shows that the proposed T-Pose-LSTM model advances the state-of-the-art 2D-based method for human trajectory prediction in long-term mobile robot deployments.

研究の動機と目的

  • 既存の2D軌道予測手法が方位情報および長期間の空間的・時間的文脈を欠いているという限界に対処する。
  • 延長されたロボット運用から得られる文脈特化型データを活用することで、実世界のサービスロボット展開における長期間歩行者軌道予測を向上させる。
  • 2D位置の予測にとどまらず、3DOFポーズ(x, y, サイニング)を予測するデータ駆動型モデルを開発し、自律ロボットの現実性と有用性を高める。
  • 手動ラベル付きデータセットに依存せず、長期間のロボット展開から得られる実世界のアノテーションなしセンサデータを活用する。
  • 今後の研究を支援するため、ケアホーム環境で3D LiDARを用いて収集した新規の3D歩行者軌道データセットを公開する。

提案手法

  • 3DOFポーズ観測(x, y, サイニング)と時刻(日付/時刻)を入力として受ける、シーケンス・ツー・シーケンスLSTMエンコーダ・デコーダアーキテクチャであるT-Pose-LSTMを提案する。
  • 環境特有の人間行動を長期間にわたりモデル化するため、日付および時刻という時間的文脈を追加の入力特徴として統合する。
  • 長期間の観測間隔(1Hz)には1層LSTMを、短期間の間隔(2.5Hz)には3層共有LSTMを用い、シーケンス長とモデル容量のバランスを取る。
  • すべての入力次元(x, y, サイニング、日付、時刻)を標準正規分布(N(0,1))に正規化する前処理を実施する。
  • 2次元および3次元LiDARセンサーを装備した自律移動型ロボットからの実世界データを用いて、手動アノテーションを一切使わず、エンド・ツー・エンドでモデルを学習する。
  • 画像ベースのアノテーションに依存せずに、強力な人間検出・追跡およびSLAMシステムを活用して、グローバル座標軌道を抽出する。

実験結果

リサーチクエスチョン

  • RQ1長期間にわたる深層学習モデルに、日付および時刻という長期的時間的文脈を組み込むことで、延長された期間における3DOF歩行者軌道予測の精度が向上するか?
  • RQ2位置と方位の両方を予測する3DOFポーズ予測と、位置のみを予測する2D位置予測とを比較した場合、長期間の精度および耐障害性にどのような差が生じるか?
  • RQ3実世界のアノテーションなしロボット展開データを用いて学習したデータ駆動型LSTMモデルは、既存の2D軌道予測ベースラインをどの程度上回るか?
  • RQ4静的歩行者が多数存在するデータセットでは、ポーズ推定が不正確であるが、モデルの性能はどの程度保たれるか?
  • RQ5長期間の展開から得られる空間的・時間的文脈の統合は、5秒を超える予測において、より信頼性の高い予測を実現するか?

主な発見

  • STRANDSデータセットにおいて、T-Pose-LSTMは全モデルの中で最小の平均位置ずれ誤差(ADE)を達成し、5秒以上の予測において顕著な性能優位性を示した。
  • 5秒を超える予測において、T-Pose-LSTMはPose-LSTMおよびベースラインモデルを大きく上回った。これは、時間情報の統合による利点を裏付けた。
  • L-CASデータセットにおいて、Pose-LSTMはSocial-LSTMベースラインと比較してADEを約10–20%低減した。これは、位置に加えて方位を予測することの価値を示している。
  • L-CASデータセットにおいて、Pose-LSTMのAVEは0.95mであったのに対し、ベースラインのSocial-LSTMは1.19mであった。これは、3DOF入力を用いることで位置予測精度が向上したことを確認した。
  • L-CASデータセットにおけるPose-LSTMのAEDE(平均オイラー角差分誤差)は35度であったが、これは静的個体のポーズ推定が不正確であるため、STRANDSよりも高かった。
  • 観測シーケンスが長くなるほど予測精度が向上し、短くなると劣化することが確認された。これは、十分な時間的文脈が、LSTMベースの予測に不可欠であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。