Skip to main content
QUICK REVIEW

[論文レビュー] Robust Trajectory Forecasting for Multiple Intelligent Agents in Dynamic Scene

Yanliang Zhu, Dongchun Ren|arXiv (Cornell University)|May 27, 2020
Autonomous Vehicle Technology and Safety参考文献 26被引用数 14
ひとこと要約

本稿では、空間的・時間的相互作用の統合的モデリング、HDマップを用いた環境特徴の符号化、およびアテンションを用いたマルチモーダル予測ネットワークを組み合わせることで、動的シーンにおける複数の知能的エージェントのロバストな軌跡予測手法を提案する。本手法は、ArgoverseでADEとFDEをそれぞれ最大14%および11%削減し、SOTA性能を達成しており、ETH/UCYおよびApolloScapeデータセットでも既存手法を上回る性能を示した。

ABSTRACT

Trajectory forecasting, or trajectory prediction, of multiple interacting agents in dynamic scenes, is an important problem for many applications, such as robotic systems and autonomous driving. The problem is a great challenge because of the complex interactions among the agents and their interactions with the surrounding scenes. In this paper, we present a novel method for the robust trajectory forecasting of multiple intelligent agents in dynamic scenes. The proposed method consists of three major interrelated components: an interaction net for global spatiotemporal interactive feature extraction, an environment net for decoding dynamic scenes (i.e., the surrounding road topology of an agent), and a prediction net that combines the spatiotemporal feature, the scene feature, the past trajectories of agents and some random noise for the robust trajectory prediction of agents. Experiments on pedestrian-walking and vehicle-pedestrian heterogeneous datasets demonstrate that the proposed method outperforms the state-of-the-art prediction methods in terms of prediction accuracy.

研究の動機と目的

  • 複雑な動的シーンにおける複数の相互作用するエージェントを対象とした、正確で長期的な軌跡予測の課題に取り組む。
  • エージェント間の社会的相互作用と、道路トポロジーなどの環境的要因を同時にモデリングし、予測のロバスト性を向上させる。
  • RNNベースのモデルがグローバルな空間的・時間的依存関係とシーンの文脈を捉えきれないという限界を克服する。
  • 異種のエージェント特徴と環境に適応した表現を統合することで、予測精度を向上させる。
  • 歩行者と車両の相互作用を含む多様なシナリオに一般化可能な、ロバストでマルチモーダルな軌跡予測を実現する。

提案手法

  • LSTMで符号化された過去の軌跡を用いて、ソフトエージェント追跡モジュールを備えたインタラクションネットを採用し、グローバルな空間的・時間的相互作用をモデリングする。
  • 事前学習済みのCNNを用いて道路トポロジーの高精度(HD)マップを符号化する環境ネットを導入し、シーンの文脈表現を実現する。
  • アテンション機構を用いてエージェント間の相互作用を適応的に重み付けし、関連する社会的ダイナミクスに焦点を当てる。
  • 空間的・時間的相互作用特徴、環境特徴、過去の軌跡、およびランダムノイズを統合し、マルチモーダル予測のための予測ヘッドを構築する。
  • ADEとFDEを損失関数として用い、すべてのモジュールを統合的に最適化するエンドツーエンドの学習を実施する。
  • Argoverseでの評価において、エゴピアスおよびワールド座標系の両方を用い、エゴモーションおよび計画された軌跡特徴を統合する。

実験結果

リサーチクエスチョン

  • RQ1複数のエージェント間のグローバルな空間的・時間的相互作用を、ロバストな軌跡予測に効果的にモデリングするにはどうすればよいか?
  • RQ2高精度マップ特徴を組み込むことで、動的シーンにおける軌跡予測精度はどの程度向上するか?
  • RQ3相互作用特徴と環境特徴のアテンションベースの統合は、マルチモーダル予測性能を向上させ得るか?
  • RQ4本手法は、シーンの複雑さやエージェントタイプが異なる多様なデータセットに、どのように一般化するか?
  • RQ5各コンポonent(インタラクション、環境、トラッキングなど)の個々の寄与度は、全体の予測精度にどの程度寄与しているか?

主な発見

  • ワールド座標系を用いた場合、ArgoverseでSocial GANと比較してADEを14%、FDEを11%削減した。
  • Argoverseデータセットのエゴピアス設定において、2位の手法(Social LSTM)と比較して、ADEを11%、FDEを4%改善した。
  • アブレーションスタディの結果、位置特徴(PF)とトラッキング特徴(TF)が最も顕著な寄与を示し、それぞれ0.47および0.14の誤差削減を達成した。
  • 環境特徴(EF)とエゴ軌跡特徴(ETF)も有意義な寄与を示し、それぞれ0.2および0.4の誤差削減を達成した。
  • すべてのベンチマークデータセットにおいて、ベースラインモデル(Linear、KF、vanilla-LSTM)およびSOTA手法(Social-LSTM、Social-GAN、Sophie)を上回った。
  • 軌跡がより直線的であるETH-hotelサブセットにおいても、非線形モデル(Social-GAN、Sophie)を上回ったことから、本手法の強力な一般化能力が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。