Skip to main content
QUICK REVIEW

[論文レビュー] STINet: Spatio-Temporal-Interactive Network for Pedestrian Detection and Trajectory Prediction

Zhishuai Zhang, Jiyang Gao|arXiv (Cornell University)|May 8, 2020
Autonomous Vehicle Technology and Safety参考文献 29被引用数 9
ひとこと要約

STINet は、LiDAR ポイントクラウドからの歩行者検出と軌道予測を統合的に処理するエンドツーエンドの2段階型空間時間的相互作用ネットワークを提案する。現在および過去のバウンディングボックスを用いた時間的プロポーザルを生成し、グラフを介して相互作用をモデル化することで、Waymo Open Dataset において 80.73 BEV AP および 33.67 cm ADE の最先端性能を達成した。同時に、1 フレームあたり 74.6 ms のリアルタイム推論を維持している。

ABSTRACT

Detecting pedestrians and predicting future trajectories for them are critical tasks for numerous applications, such as autonomous driving. Previous methods either treat the detection and prediction as separate tasks or simply add a trajectory regression head on top of a detector. In this work, we present a novel end-to-end two-stage network: Spatio-Temporal-Interactive Network (STINet). In addition to 3D geometry modeling of pedestrians, we model the temporal information for each of the pedestrians. To do so, our method predicts both current and past locations in the first stage, so that each pedestrian can be linked across frames and the comprehensive spatio-temporal information can be captured in the second stage. Also, we model the interaction among objects with an interaction graph, to gather the information among the neighboring objects. Comprehensive experiments on the Lyft Dataset and the recently released large-scale Waymo Open Dataset for both object detection and future trajectory prediction validate the effectiveness of the proposed method. For the Waymo Open Dataset, we achieve a bird-eyes-view (BEV) detection AP of 80.73 and trajectory prediction average displacement error (ADE) of 33.67cm for pedestrians, which establish the state-of-the-art for both tasks.

研究の動機と目的

  • 既存手法が検出と軌道予測を別々に処理する、または粗い時間的統合を用いるという限界を是正すること。
  • 特にグループ状態での歩行者同士の相互作用を明示的にモデル化することで、軌道予測の精度を向上させること。
  • 検出と予測の最適化を統合的に最適化することで、エンドツーエンドでの空間時間的表現の学習を可能にすること。
  • 自動運転応用において、高い精度を維持したままリアルタイム推論を実現すること。

提案手法

  • バックボーンネットワークは、PointPillars を模倣したアーキテクチャを用いて各ポイントクラウドフレームを処理し、フレームごとの特徴量を抽出する。
  • 時間的プロポーザルは、現在および過去の歩行者位置を予測することで生成され、明示的なトラッキングを必要とせずにフレーム間のオブジェクト関連付けを可能にする。
  • プロポーザル生成ネットワークは、複数フレームの特徴量を統合し、幾何、運動、履歴パスの特徴量を備えた空間時間的プロポーザルを生成する。
  • グラフニューラルネットワークを用いて、周辺の歩行者同士の相互作用をモデル化し、軌道予測の精度を向上させる。
  • プロポーザル予測ネットワークは、強化された空間時間的相互作用特徴量を用いて、検出ボックスおよび将来の軌道を回帰する。
  • ネットワーク全体は、検出と軌道予測のヘッドを統合的に最適化することでエンドツーエンドに訓練される。

実験結果

リサーチクエスチョン

  • RQ1検出と軌道予測の統合的エンドツーエンド学習は、モジュラーなパイプラインを上回る性能を発揮できるか?
  • RQ2現在および過去のオブジェクト位置を同時にモデル化することで、空間時間的表現学習がどの程度向上するか?
  • RQ3歩行者同士の相互作用をモデル化することで、特に5人以上のグループ状態での軌道予測精度がどの程度向上するか?
  • RQ42段階のプロポーザルベース設計は、単一段階の検出器に比べて、検出と予測の統合的性能を向上させられるか?
  • RQ5実世界の自動運転シナリオにおいて、精度と推論速度のトレードオフはどのようなものか?

主な発見

  • STINet は、Waymo Open Dataset において、ベーシックエイド(BEV)検出平均適合度(AP)が 80.73 に達し、新たな最先端性能を樹立した。
  • 軌道予測に関しては、歩行者に対して平均移動誤差(ADE)が 33.67 cm に達し、Waymo Open Dataset でも新たな最先端性能を記録した。
  • 相互作用モデル化部のおかげで、5人以上のグループに属する歩行者の DE@3 が 1.6% 向上した。
  • 100m × 100m の範囲において、STINet は 1 フレームあたり 74.6 ms のリアルタイム推論を達成し、10 Hz を超えた。
  • アブレーションスタディの結果、履歴パス特徴量だけでは正確な予測が不十分であることが示され、空間時間的および相互作用モデル化の統合的必要性が強調された。
  • 定性的な結果から、曲がり角を曲がる歩行者やグループ歩行者の軌道予測において、MF-FRCNN や IntentNet といったベースラインに比べ、優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。