[論文レビュー] PedFormer: Pedestrian Behavior Prediction via Cross-Modal Attention Modulation and Gated Multitask Learning
PedFormerは、エゴセントリックな動画、モーショントラック、シーンデータを用いて、歩行者の軌跡と横断行動を同時に予測する、ゲート付きマルチタスク学習を組み込んだクロスモーダルなTransformerベースのフレームワークを提案する。クロスモーダルアテンション、ダイナミックなインタラクションモデリング、ゲート付きハイブリッドデコーダーを統合することで、軌跡予測で最大22%、行動予測で最大13%の性能向上を達成し、SOTAを更新した。
Predicting pedestrian behavior is a crucial task for intelligent driving systems. Accurate predictions require a deep understanding of various contextual elements that potentially impact the way pedestrians behave. To address this challenge, we propose a novel framework that relies on different data modalities to predict future trajectories and crossing actions of pedestrians from an ego-centric perspective. Specifically, our model utilizes a cross-modal Transformer architecture to capture dependencies between different data types. The output of the Transformer is augmented with representations of interactions between pedestrians and other traffic agents conditioned on the pedestrian and ego-vehicle dynamics that are generated via a semantic attentive interaction module. Lastly, the context encodings are fed into a multi-stream decoder framework using a gated-shared network. We evaluate our algorithm on public pedestrian behavior benchmarks, PIE and JAAD, and show that our model improves state-of-the-art in trajectory and action prediction by up to 22% and 13% respectively on various metrics. The advantages brought by components of our model are investigated via extensive ablation studies.
研究の動機と目的
- 都市ドライブシナリオにおける歩行者行動を正確に予測する課題に取り組むために、将来の軌跡と横断行動を同時にモデリングする。
- 視覚的、モーショントラック的、シーンコンテキストのマルチモーダルデータをクロスモーダルアテンション機構を用いて活用することで、予測性能を向上させる。
- 歩行者と交通参加者間のインタラクションモデリングを向上させるために、エゴ車両および歩行者のダイナミクスを統合した意味的シーン表現を組み込む。
- タスク間で知識を効果的に共有しつつ干渉を最小限に抑えることのできる、頑健なデコーディングアーキテクチャを設計する。
- PIEおよびJAADの公開ベンチマークを用いた広範なアブレーションスタディを通じて、各モジュールの有効性を検証する。
提案手法
- モデルは、異なるデータタイプからのクエリ、キー、バリュー表現を用いて、視覚的、モーショントラック的、シーンモダリティ間の依存関係を学習するクロスモーダルなTransformerエンコーダーを採用する。
- インタラクションモデリングモジュールは、二重アテンション機構を用いて、歩行者およびエゴ車両のダイナミクスと意味的シーン特徴を統合し、文脈に適した表現を生成する。
- インタラクション表現は、モダリティエンコーディング出力と連結され、ターゲットの軌跡と行動を同時に予測するゲート付きハイブリッドマルチストリームデコーダーに供給される。
- ゲート付きデコーダーは、共有表現からタスク固有のデコーダーへの情報フローを制御する学習可能なゲーティング機構を用いることで、特徴の選択的利用を可能にする。
- フレームワークは、共有およびタスク固有のヘッドを用いて、軌跡と行動予測を同時に最適化するマルチタスク学習目的関数を採用する。
- モデルは、ADE、FDE、AUC、F1、IoUといった標準指標を用いて、PIEおよびJAADデータセット上でエンドツーエンドで訓練される。
実験結果
リサーチクエスチョン
- RQ1視覚的、モーショントラック的、シーンデータ間のクロスモーダルアテンションの調節は、歩行者行動予測にどのように寄与するか?
- RQ2歩行者とエゴ車両間のダイナミックなインタラクションモデリングを組み込むことで、予測精度はどの程度向上するか?
- RQ3ゲート付きハイブリッドデコーダーアーキテクチャは、共有またはタスク固有のデコーダーと比較して、マルチタスク歩行者予測においてどのように性能を発揮するか?
- RQ4クロスモーダルアテンション、インタラクションモデリング、ゲート付きデコーディングといった各モジュールの、全体のパフォーマンスへの寄与度は何か?
- RQ5軌跡と行動の同時予測は、単一タスクアプローチよりも優れた性能を達成できるか?
主な発見
- PedFormerはPIEおよびJAADベンチマークの両方でSOTAを達成し、軌跡予測指標(ADE、FDE、ARB、FRB)で最大22%の向上を示した。
- クロスモーダルアテンションの導入により、性能が顕著に向上し、アテンションなしのベースラインと比較して、軌跡指標で最大12%、行動指標(AUC、F1)で最大3%の向上が得られた。
- 提案されたインタラクションモデリングモジュール(モーショントラックと意味的シーン特徴の統合)は、アブレーションベースラインと比較して、軌跡予測で最大12%、行動予測で最大3%の向上を達成した。
- ゲート付きハイブリッドデコーダーは、タスクベース、共有、バイフォールドデコーダーを上回り、軌跡指標で最大12%、行動指標で最大4%の向上を達成した。
- アブレーションスタディの結果、モーショントラッキングのエンコーディングを削除する、またはアテンションベースのインタラクションモデリングに代えて単純な1×1畳み込みを用いることで性能が低下することが確認され、動的コンテキストの重要性が示された。
- 定性的な結果から、PedFormerは特に旋回や加速などの高エゴモーショントラッキング状況下でも、より正確で頑健な予測を生成することがわかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。