Skip to main content
QUICK REVIEW

[論文レビュー] Potential Field: Interpretable and Unified Representation for Trajectory Prediction

Shan Su, Peng Cheng|arXiv (Cornell University)|Nov 18, 2019
Autonomous Vehicle Technology and Safety参考文献 38被引用数 11
ひとこと要約

本稿では、環境的、慣性的、社会的刺激を統一的で解釈可能な表現としてポテンシャル場を用いる、新しい軌跡予測フレームワークを提案する。力の要因を学習可能でデータ駆動のポテンシャル場としてモデル化し、将来の運動をガウス分布に従う速度場から予測することで、ETH、UCY、Stanford Droneデータセットにおいて最先端の性能を達成した。これにより、解釈性の向上と複数ソースの運動センサの統合が実現された。

ABSTRACT

Predicting an agent's future trajectory is a challenging task given the complicated stimuli (environmental/inertial/social) of motion. Prior works learn individual stimulus from different modules and fuse the representations in an end-to-end manner, which makes it hard to understand what are actually captured and how they are fused. In this work, we borrow the notion of potential field from physics as an interpretable and unified representation to model all stimuli. This allows us to not only supervise the intermediate learning process, but also have a coherent method to fuse the information of different sources. From the generated potential fields, we further estimate future motion direction and speed, which are modeled as Gaussian distributions to account for the multi-modal nature of the problem. The final prediction results are generated by recurrently moving past location based on the estimated motion direction and speed. We show state-of-the-art results on the ETH, UCY, and Stanford Drone datasets.

研究の動機と目的

  • 環境的、慣性的、社会的刺激を個別に扱う既存の軌跡予測モデルに見られる解釈性の欠如と一貫性のない統合の問題に対処すること。
  • 多様な運動刺激の間接的監視と一貫性のある統合を可能にする統一的表現を開発すること。
  • 速度の方向と大きさをガウス分布として予測することで、人間の運動の多モーダル性をモデル化すること。
  • ニューラルネットワークを用いてポテンシャル場の知識を明示的なシーンアノテーションなしに未観測環境に一般化すること。
  • 解釈性を維持したまま、標準的な軌跡予測ベンチマークで最先端の性能を達成すること。

提案手法

  • 観測された軌跡からポテンシャル場の値を逆問題として推定し、学習のための教師データとして用いる。
  • 環境的(歩行可能領域と障害物)、慣性的(過去の運動に起因する意図)、社会的(周囲との相互作用)の3つの異なるポテンシャル場を定義する。
  • RGB画像と軌跡データを入力として、ニューラルネットワークを用いて環境的および慣性的ポテンシャル場を未観測のシーンに一般化する。
  • ピixeL単位の加算を用いて、環境的、慣性的、社会的ポテンシャル場を統合し、統一された運動場を生成する。
  • 統合されたポテンシャル場から、方向と大きさの両方をガウス分布として予測し、将来の速度を予測する。
  • 予測された速度場を時間的に再帰的に統合することで、最終的な軌跡を生成する。

実験結果

リサーチクエスチョン

  • RQ1ポテンシャル場は、環境的、慣性的、社会的刺激といった多様な運動刺激を統一的で解釈可能な表現としてモデル化できるか?
  • RQ2解釈可能なポテンシャル場を用いた中間監視により、複数ソースの運動センサの学習と統合が向上するか?
  • RQ3明示的なシーンアノテーションなしに、ニューラルネットワークが学習したポテンシャル場の知識を未観測環境に一般化できるか?
  • RQ4本手法は、構造のない環境、複雑なトポロジー、社会的相互作用を伴う複雑な現実世界のシナリオにおいて、どのように性能を発揮するか?
  • RQ5多モーダルな速度予測を組み込むことで、軌跡予測の正確性がどの程度向上するか?

主な発見

  • 提案手法は、ETH、UCY、Stanford Droneデータセットにおいて、S-LSTM、DESIRE、Gated-RN、CVAEを上回る最先端の性能を達成した。単一モードおよび多モード予測の両設定で優れた結果を示した。
  • アブレーションスタディの結果、環境的および社会的ポテンシャル場を追加することで、慣性的ポテンシャル場のみを用いたモデルに比べて性能が顕著に向上した。
  • SDDデータセットにおいて4:1の訓練・テスト分割を用いた結果、未観測のシーンへの一般化が良好に行われていることが示された。
  • 定性的な結果から、ポテンシャル場がデータから複雑な道路構造(例えば、円形交差点、横断歩道)や人の歩行習慣(例えば、道路の右側を歩く)を学習していることが明らかになった。
  • 社会的シナリオにおいて、曲がる、止まる、相互作用(出会い、後続)を経由するなど、多様な行動を適切に予測できた。
  • ガウス分布に従う速度予測の導入により、人間の運動の本質的な多モーダル性が捉えられ、1〜4秒の予測時間窓においてFDEおよびADE指標の向上が観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。