Skip to main content
QUICK REVIEW

[論文レビュー] PePScenes: A Novel Dataset and Baseline for Pedestrian Action Prediction in 3D

Amir Rasouli, Tiffany Yau|arXiv (Cornell University)|Dec 14, 2020
Autonomous Vehicle Technology and Safety参考文献 20被引用数 8
ひとこと要約

本稿では、ペルフレームの2次元/3次元バウンディングボックスおよび歩行者の横断行動に関する行動アノテーションを追加することで、nuScenesを拡張した新しい3次元歩行者行動予測データセットPePScenesを紹介する。視覚的、地図的、軌跡的モダリティを統合したハイブリッドディープラーニングモデルを提案し、横断予測において48%のF1スコアを達成し、最先端の性能を示した。これにより、マルチモーダル統合が行動予測の精度を顕著に向上させることを実証した。

ABSTRACT

Predicting the behavior of road users, particularly pedestrians, is vital for safe motion planning in the context of autonomous driving systems. Traditionally, pedestrian behavior prediction has been realized in terms of forecasting future trajectories. However, recent evidence suggests that predicting higher-level actions, such as crossing the road, can help improve trajectory forecasting and planning tasks accordingly. There are a number of existing datasets that cater to the development of pedestrian action prediction algorithms, however, they lack certain characteristics, such as bird's eye view semantic map information, 3D locations of objects in the scene, etc., which are crucial in the autonomous driving context. To this end, we propose a new pedestrian action prediction dataset created by adding per-frame 2D/3D bounding box and behavioral annotations to the popular autonomous driving dataset, nuScenes. In addition, we propose a hybrid neural network architecture that incorporates various data modalities for predicting pedestrian crossing action. By evaluating our model on the newly proposed dataset, the contribution of different data modalities to the prediction task is revealed. The dataset is available at https://github.com/huawei-noah/PePScenes.

研究の動機と目的

  • 自律走行における歩行者行動予測のための、3次元的で地図に配慮した、かつ高レベルの行動アノテーションが付与されたデータセットの不足を解消すること。
  • 視覚的、地図的、軌跡的データを統合するマルチモーダルディープラーニングモデルを構築し、正確な歩行者横断行動予測を実現すること。
  • シーン画像、セマンティックマップ、軌跡などの異なるデータモダリティ(例:シーン画像、セマンティックマップ、軌跡)が行動予測性能に与える寄与度を評価すること。
  • 今後の3次元歩行者行動予測分野の研究のためのベンチマークデータセットとベースラインモデルを提供すること。

提案手法

  • データセットは、63.4万件のペルフレーム歩行者行動アノテーションと452万件のバウンディングボックスアノテーション(3次元位置と2次元/3次元ボックスラベルを含む)を備えたnuScenesの拡張である。
  • 視覚的、地図的、軌跡的モダリティを統合するハイブリッドニューラルネットワークアーキテクチャを採用。シーン画像(300×300)、セマンティックマップ(30×30m、3チャネル)、歩行者/エゴ車両の軌跡(x,z座標と速度)を入力とする。
  • 視覚特徴は、2つの並列のConv2Dストリームネットワーク(フィルターサイズ:[32,3,3]、[64,3,2]、[128,3,2] および [64,3,3]、[128,3,2]、[256,3,2])を用いて抽出し、その後グローバル平均プーリングを実施。
  • 軌跡およびエゴ車両状態特徴は、2つの別個の128セルLSTMで符号化され、視覚的および動的特徴が連結されて最終表現が形成される。
  • 統合表現は、ドロップアウト率0.5の2層の全結合層を通過し、行動分類に使用。損失関数にはバイナリクロスエントロピーを採用。
  • モデルはエンドツーエンドで訓練され、RMSPropを用い、バッチサイズ8、学習率5×10⁻⁵で50エポック実行。データの不均衡を補うためにクラスウェイトを適用。

実験結果

リサーチクエスチョン

  • RQ1視覚的、地図的、軌跡的といった異なるデータモダリティ(例:シーン画像、セマンティックマップ、軌跡)が、歩行者横断行動予測精度にどのように寄与するか?
  • RQ2マルチモーダルディープラーニングモデルは、ユニモーダルベースラインを上回る性能を示せるか?
  • RQ33次元シーンコンテキストとセマンティックマップを統合することで、2次元のみまたは軌跡のみのモデルに比べ、行動予測の精度がどの程度向上するか?
  • RQ43次元的で地図に配慮したデータセット上で、提案モデルはSF-GRUなどの最先端手法を上回る性能を示せるか?

主な発見

  • 提案されたハイブリッドモデルは、歩行者横断予測において48%のF1スコアを達成し、ユニモーダルベースラインを顕著に上回った。
  • 軌跡データのみを用いた場合、F1スコアは20%にとどまり、視覚的または地図的コンテキストが欠如していると予測性能が著しく制限されることを示した。
  • シーン画像とマップ画像を統合した場合、F1スコアは35%に向上し、視覚的コンテキストが行動認識を向上させることを実証した。
  • マップ+シーン特徴に軌跡データを追加することで、F1スコアは43%に上昇し、動的運動パターンが予測に不可欠であることを示した。
  • 全モダリティを統合した完全なモデルは、最高のAUC(0.71)と47%の精度を達成し、マルチモーダル統合の有効性を確認した。
  • データセットには719人の歩行者が行動アノテーション付きで収録されており、そのうち149人が横断行動を示しており、10Hzのフレームで合計106万件の歩行者バウンディングボックスアノテーションが含まれている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。