Skip to main content
QUICK REVIEW

[論文レビュー] Perceive, Interact, Predict: Learning Dynamic and Static Clues for End-to-End Motion Prediction

Bo Jiang, Shaoyu Chen|arXiv (Cornell University)|Dec 5, 2022
Autonomous Vehicle Technology and Safety被引用数 4
ひとこと要約

本論文では、人為的アノテーションによるHDマップや履歴追跡を必要とせず、ビデオ入力のみでオンラインマッピング、物体検出、運動予測を統合的に行うエンドツーエンドのTransformerベースのフレームワーク、PIPを提案する。マップ、エージェント、モードのクエリを用い、微分可能なマルチタスク相互作用機構を採用することで、0.258 EPAの最先端性能を達成し、追跡ベースおよびHDマップベースの手法を上回る。

ABSTRACT

Motion prediction is highly relevant to the perception of dynamic objects and static map elements in the scenarios of autonomous driving. In this work, we propose PIP, the first end-to-end Transformer-based framework which jointly and interactively performs online mapping, object detection and motion prediction. PIP leverages map queries, agent queries and mode queries to encode the instance-wise information of map elements, agents and motion intentions, respectively. Based on the unified query representation, a differentiable multi-task interaction scheme is proposed to exploit the correlation between perception and prediction. Even without human-annotated HD map or agent's historical tracking trajectory as guidance information, PIP realizes end-to-end multi-agent motion prediction and achieves better performance than tracking-based and HD-map-based methods. PIP provides comprehensive high-level information of the driving scene (vectorized static map and dynamic objects with motion information), and contributes to the downstream planning and control. Code and models will be released for facilitating further research.

研究の動機と目的

  • 高価で静的または古くなったマップデータに依存するHDマップ依存型および追跡ベースの運動予測手法の限界を解消すること。
  • 人為的アノテーションによるHDマップやエージェントの履歴軌道を必要とせず、ビデオ入力から直接エンドツーエンドで運動予測を学習すること。
  • 動的エージェント、静的マップ要素、運動意図の間の相互作用をモデル化する統一されたクエリベースのフレームワークを通じて、認識と予測を共同最適化すること。
  • 認識と予測の相関を活用するための完全に微分可能なマルチタスク相互作用機構を開発すること。

提案手法

  • PIPは、静的マップ要素、動的エージェント、運動意図のインスタンスワイズ表現をそれぞれエンコードするための3種類のクエリ(マップクエリ、エージェントクエリ、モードクエリ)を採用する。
  • モーションインタラクタモジュールにより、エージェント中心の表現とマップ特徴の間で明示的および暗黙的な相互作用が可能となり、アテンション機構を用いてマップコンテキストとエージェント状態を統合する。
  • 予測のばらつきを低減するために、エゴセントリックからエージェントセントリックな座標系に切り替えるエージェント単位の正規化を実施する。
  • エージェントからの信頼度スコアと空間的近接性に基づいてマップ特徴をフィルタリングし、予測に適切なマップコンテキストを使用する。
  • 検出、マッピング、運動予測の目的関数を組み合わせたマルチタスク損失を用い、学習可能な損失重みでエンドツーエンドで学習する。
  • マップ特徴をインスタンスレベルの表現にさらにエンコードするため、VectorNetを用いてマップ特徴のエンコードを強化する。

実験結果

リサーチクエスチョン

  • RQ1事前構築されたHDマップに依存せず、生のビデオ入力からのみ、オンラインマッピング、物体検出、運動予測を統合的に学習できるエンドツーエンドフレームワークは実現可能か?
  • RQ2統一されたクエリベースのTransformerアーキテクチャにおいて、微分可能でマルチタスクの相互作用機構を通じて認識と予測を効果的に相関付ける方法は何か?
  • RQ3ビデオのみの入力で、HDマップや履歴追跡データを用いる手法と同等またはそれ以上の運動予測性能を達成できるか、その程度は何か?
  • RQ4明示的および暗黙的なマップ-エージェント相互作用は、軌道予測の正確性と多様性にどのような影響を与えるか?

主な発見

  • PIPは0.258 EPAを達成し、以前の最先端手法[11]を上回り、HDマップや追跡を一切不要としているにもかかわらず優れた運動予測性能を示した。
  • 以前のSOTAと比較して、minADEが0.91m、minFDEが1.17m改善され、軌道予測の正確性に顕著な向上が見られた。
  • 予測されたベクトル化マップを用いた場合のモデル性能は、真値のHDマップを用いた場合とほぼ同等であり、minADEでわずか0.01mの差にとどまり、マップ予測誤差に対して高いロバスト性を示した。
  • アブレーションスタディにより、マルチタスク相互作用設計の有効性が確認され、特にエージェント単位の正規化と信頼度ベースのマップフィルタリングの重要性が示された。
  • 定性的な結果から、PIPは意味的なエージェント-マップ相関を学習し、特に合流する車両に対して多様で現実的なマルチモーダル予測を生成することが可能であることが分かった。
  • フレームワークは、ベクトル化されたマップと運動に敏感な物体検出結果という包括的な高レベルのシーン表現を出力し、後続の計画や制御に活用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。