Skip to main content
QUICK REVIEW

[論文レビュー] LatentFormer: Multi-Agent Transformer-Based Interaction Modeling and Trajectory Prediction

Elmira Amirloo, Amir Rasouli|arXiv (Cornell University)|Mar 3, 2022
Autonomous Vehicle Technology and Safety被引用数 13
ひとこと要約

LatentFormerは、将来状態を自己回帰的に参照することで、エージェント間の相互作用を統合的にモデル化する階層的トランスフォーマー・アーキテクチャを用いたマルチエージェント軌跡予測モデルを提案する。また、ビジョントランスフォーマーを用いたマルチスケール地図符号化も統合している。このモデルはnuScenesベンチマークで最先端の性能を達成し、従来手法比で軌跡評価指標を最大40%向上させた。

ABSTRACT

Multi-agent trajectory prediction is a fundamental problem in autonomous driving. The key challenges in prediction are accurately anticipating the behavior of surrounding agents and understanding the scene context. To address these problems, we propose LatentFormer, a transformer-based model for predicting future vehicle trajectories. The proposed method leverages a novel technique for modeling interactions among dynamic objects in the scene. Contrary to many existing approaches which model cross-agent interactions during the observation time, our method additionally exploits the future states of the agents. This is accomplished using a hierarchical attention mechanism where the evolving states of the agents autoregressively control the contributions of past trajectories and scene encodings in the final prediction. Furthermore, we propose a multi-resolution map encoding scheme that relies on a vision transformer module to effectively capture both local and global scene context to guide the generation of more admissible future trajectories. We evaluate the proposed method on the nuScenes benchmark dataset and show that our approach achieves state-of-the-art performance and improves upon trajectory metrics by up to 40%. We further investigate the contributions of various components of the proposed technique via extensive ablation studies.

研究の動機と目的

  • 自動運転における正確で多様かつ妥当なマルチエージェント軌跡予測の課題に対処すること。
  • 過去の軌跡に加え、予測された将来状態に条件づけてエージェント間の動的相互作用をモデル化すること。
  • ビジョントランスフォーマーを用いたマルチスケール符号化スキームにより、局所的およびグローバルな地図表現を統合することで、シーンの文脈理解を向上させること。
  • 過去の軌跡と地図特徴に基づいたCVAEフレームワークを用いてエージェントの意図を推論することで、マルチモーダルな予測を可能にすること。
  • 計算効率と予測品質のトレードオフを評価するため、自己回帰的および非自己回帰的推論の比較を行うこと。

提案手法

  • 予測されたエージェント状態をクエリとして用い、過去の観測とシーンの文脈に関する信念を更新する階層的アテンション機構を採用する。
  • 将来状態の予測を自己回帰的に組み込むことで、矛盾を解消し一貫性を向上させる、新しい相互作用モデリングモジュールを導入する。
  • 局所的およびグローバルな地図パッチを抽出するマルチスケール地図符号化スキームを採用し、トランスフォーマーを用いて位置不変性バイアスを低減する。
  • エージェント状態に応じて地図表現を動的に整列させ、デコード中にエージェントと環境の相互作用をモデル化する。
  • 条件付き変分オートエンコーダ(CVAE)フレームワークを用いて、離散的なエージェントの意図を推論し、マルチモーダルな軌跡生成を可能にする。
  • 自己回帰的および非自己回帰的デコードモードをサポートし、後者は並列推論を可能にすることで効率性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1デコード中に将来のエージェント状態をモデル化することで、マルチエージェント軌跡予測の整合性と正確性が向上するか?
  • RQ2ビジョントランスフォーマーを用いたマルチスケール地図符号化スキームは、従来のCNNベースの地図エンコーダーよりも、シーンの文脈をどれほどよく捉えられるか?
  • RQ3すべてのエージェントを独立に予測するのではなく、同時に予測することで、軌跡の品質と多様性はどの程度向上するか?
  • RQ4予測精度と計算効率の観点から、自己回帰的と非自己回帰的推論の間にはどのようなトレードオフがあるか?
  • RQ5個々のモジュール(相互作用モデリング、地図符号化、意図推論)は、全体の性能にどの程度寄与しているか?

主な発見

  • LatentFormerはnuScenesベンチマークで最先端の性能を達成し、minADEを0.38、avgFDEを1.81まで低下させ、ベースラインモデル比で最大40%の改善を達成した。
  • 地図符号化と相互作用モデリングモジュールの両方を組み込むことで顕著な性能向上が見られ、マルチスケールビジョントランスフォーマー地図エンコーダーが指標を最大30%向上させた。
  • 自己回帰的デコードモードは非自己回帰的バージョンを上回り、minADEは0.38(非自己回帰的:0.42)を記録したが、後者はより高速な並列推論を可能にした。
  • アブレーションスタディの結果、相互作用モデリングが顕著に寄与しており、相互作用モデリングを含まないモデルと比較してavgFDEが0.75ポイント改善された。
  • 定性的な結果から、モデルはシーン制約とエージェントダイナミクスを尊重する多様で妥当な軌跡を効果的に生成できていることが示された。
  • CVAEベースの意図モデリングにより、交差点での曲がりや進行継続といった妥当な代替行動を効果的に生成するマルチモーダル予測が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。