Skip to main content
QUICK REVIEW

[論文レビュー] MTR++: Multi-Agent Motion Prediction with Symmetric Scene Modeling and Guided Intention Querying

Shaoshuai Shi, Li Jiang|arXiv (Cornell University)|Jun 30, 2023
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、対称的シーンモデリングとガイド付き意図照会を用いて、マルチモーダルな軌道予測を向上させる、MTR++—高度なマルチエージェント運動予測フレームワークを提案する。可学習な意図クエリを用いたグローバルな意図局所化と、スタックされたトランスフォーマー・デコーダー層による反復的精錬を採用することで、MTRの後続バージョンであるMTR++は、WOMDベンチマークにおいて、精度、推論速度、メモリ効率の面で最先端の性能を達成した。

ABSTRACT

Motion prediction is crucial for autonomous driving systems to understand complex driving scenarios and make informed decisions. However, this task is challenging due to the diverse behaviors of traffic participants and complex environmental contexts. In this paper, we propose Motion TRansformer (MTR) frameworks to address these challenges. The initial MTR framework utilizes a transformer encoder-decoder structure with learnable intention queries, enabling efficient and accurate prediction of future trajectories. By customizing intention queries for distinct motion modalities, MTR improves multimodal motion prediction while reducing reliance on dense goal candidates. The framework comprises two essential processes: global intention localization, identifying the agent's intent to enhance overall efficiency, and local movement refinement, adaptively refining predicted trajectories for improved accuracy. Moreover, we introduce an advanced MTR++ framework, extending the capability of MTR to simultaneously predict multimodal motion for multiple agents. MTR++ incorporates symmetric context modeling and mutually-guided intention querying modules to facilitate future behavior interaction among multiple agents, resulting in scene-compliant future trajectories. Extensive experimental results demonstrate that the MTR framework achieves state-of-the-art performance on the highly-competitive motion prediction benchmarks, while the MTR++ framework surpasses its precursor, exhibiting enhanced performance and efficiency in predicting accurate multimodal future trajectories for multiple agents.

研究の動機と目的

  • 複雑なドライブシーンにおける多様なエージェント行動と豊かな環境的文脈を伴うマルチモーダルな運動予測の課題に対処すること。
  • 計算コストの増加と訓練の不安定性を引き起こす、密集したゴール候補に依存するのを減らすこと。
  • 複数のエージェントを同時に、共同でシーンに適合するマルチモーダルな軌道を予測すること。
  • 意味を持つ明示的で可学習な意図クエリを用いることで、訓練の安定性と予測精度を向上させること。
  • マルチエージェント運動予測のシナリオにおける推論効率とメモリ使用量を向上させること。

提案手法

  • MTR++フレームワークは、明示的に異なる運動モードを表す可学習な意図クエリを用いたトランスフォーマー・エンコーダ-デコーダー・アーキテクチャを採用し、密集したゴール候補への依存を低減する。
  • グローバルな意図局所化は、これらの意図クエリの確率を用いてエージェントの意図を分類することで達成され、効率的な軌道予測を可能にする。
  • 局所的移動の精錬は、文脈およびエージェント間の相互作用に基づいて予測軌道を反復的に精錬するスタックされたトランスフォーマー・デコーダー層によって実施される。
  • 対称的シーンコンテキストモデリングにより、各エージェントのシーン表現がエージェントの順序に依存しなくなり、一般化性と相互作用モデリングの向上が図られる。
  • 相互にガイドされた意図照会により、エージェント間のアテンションが可能となり、エージェント同士の予測行動に基づいて、自身の予測軌道を精錬できる。
  • 密集した将来予測モジュールは、コンテキストエンコーダーに密集した監督を提供し、特徴学習プロセスに潜在的な将来の軌道を組み込むことで、運動デコーディングを豊かにする。

実験結果

リサーチクエスチョン

  • RQ1密集したゴール候補への依存を減らしながら、複数エージェントのマルチモーダル運動予測をどのように改善できるか?
  • RQ2暗黙の潜在埋め込みと比較して、明示的で可学習な意図クエリが訓練の安定性と予測性能に与える影響は何か?
  • RQ3対称的シーンコンテキストモデリングは、マルチエージェント運動予測の一般化性と精度をどのように向上させるか?
  • RQ4相互にガイドされた意図照会は、エージェント間の相互作用モデリングを通じて、シーンに適合する軌道生成をどの程度向上させるか?
  • RQ5共同運動予測において、性能と推論効率のバランスを取る最適なデコーダー層の数は何か?

主な発見

  • MTR++フレームワークは、大規模なWOMDベンチマークにおいて最先端の性能を達成し、MTRおよび先行手法と比較してminADE、ミス率、mAPのすべてで優れた結果を示した。
  • 密集した将来予測モジュールを削除すると、mAPが1.48%低下し、このモジュールが密集した監督の提供と文脈特徴の豊かさに果たす重要な役割を示している。
  • デコーダー層の数を1から6に増やすと性能が一貫して向上し、6層で最良の結果が得られた。さらに9層に増やすと改善が見られず、収益逓減の兆しを示した。
  • 明示的な意図クエリの使用は、クエリ数が増えるに従い、暗黙の潜在埋め込みと比較して収束が速く、訓練の安定性が向上することが示された。
  • MTRに比べ、MTR++は特にエージェント数が多いシナリオにおいて、優れた推論速度とメモリ効率を達成した。
  • MTR++のmAPスコアは0.3754に達し、minADEは0.6490、ミス率は0.1559であった。これは、先行手法と比較して顕著な向上を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。