Skip to main content
QUICK REVIEW

[論文レビュー] Pedestrian Intention Prediction: A Multi-task Perspective

Smail Ait Bouhsain, Saeed Saadatnejad|arXiv (Cornell University)|Oct 20, 2020
Autonomous Vehicle Technology and Safety参考文献 28被引用数 5
ひとこと要約

本論文では、車両搭載カメラの映像シーケンスから歩行者の意図とバウンディングボックス状態(位置、幅、高さ)を同時に予測するためのマルチタスク学習手法を提案する。意図予測ヘッドと視覚的状態ヘッドの間で特徴を共有することで、意図予測において最先端の性能を達成するとともに、バウンディングボックス予測においても競争力のある結果を示し、従来手法よりも2倍以上高速な推論を実現した。

ABSTRACT

In order to be globally deployed, autonomous cars must guarantee the safety of pedestrians. This is the reason why forecasting pedestrians' intentions sufficiently in advance is one of the most critical and challenging tasks for autonomous vehicles. This work tries to solve this problem by jointly predicting the intention and visual states of pedestrians. In terms of visual states, whereas previous work focused on x-y coordinates, we will also predict the size and indeed the whole bounding box of the pedestrian. The method is a recurrent neural network in a multi-task learning approach. It has one head that predicts the intention of the pedestrian for each one of its future position and another one predicting the visual states of the pedestrian. Experiments on the JAAD dataset show the superiority of the performance of our method compared to previous works for intention prediction. Also, although its simple architecture (more than 2 times faster), the performance of the bounding box prediction is comparable to the ones yielded by much more complex architectures. Our code is available online.

研究の動機と目的

  • 自律走行車両の安全性を向上させるために、歩行者の意図を早期かつ正確に予測すること。
  • 従来の研究が単独で軌道予測または意図予測に焦点を当てていたという限界を是正すること。
  • 意図予測と併せてバウンディングボックス(x, y, w, h)の状態を共同でモデリングすることで、視覚的状態予測を向上させ、共有表現を活用すること。
  • パラメータ数を少なくし、既存手法よりも著しく高速な軽量アーキテクチャにより高い精度を達成すること。
  • 共有特徴学習を通じてマルチタスク学習の利点が、意図予測および視覚的状態予測の両方の性能向上に寄与することを検証すること。

提案手法

  • 歩行者意図(渡渉 vs. 非渡渉)の分類用とバウンディングボックス予測(x, y, w, h)用の2つの別個の出力ヘッドを持つ1つの再帰的ニューラルネットワーク(RNN)を採用する。
  • トレーニング中に意図予測損失とバウンディングボックス予測損失の重み付き和を逆誤差伝搬することでマルチタスク学習を実装する。
  • 車両搭載カメラの視点から得られる歩行者のバウンディングボックスのシーケンスを処理し、運動ダイナミクスと空間的文脈を捉える。
  • 各未来時刻で意図を予測することで、単一ステップ分類ではなく、長期間にわたる予測が可能になる。
  • バウンディングボックス予測を、中心座標と寸法の回帰問題として扱い、評価にはIOUに基づく指標(AIOU, FIOU)を用いる。
  • 精度と推論速度の両方を最適化することで、最先端のベースラインと比較してパラメータ数が少なく、推論が高速なモデルを実現した。

実験結果

リサーチクエスチョン

  • RQ1意図予測とバウンディングボックス全体の状態を同時に予測することで、単一タスク手法と比較して予測精度が向上するか?
  • RQ2共有表現を用いたマルチタスク学習が、意図予測および視覚的状態予測の両方の性能向上に寄与するか?
  • RQ3より単純で高速なアーキテクチャが、複雑なモデルと比較して、歩行者状態予測において競争力ある、あるいはより優れた性能を達成できるか?
  • RQ4特に長期予測において、観測期間や予測期間が異なる条件下で、モデルの性能はどのように変化するか?
  • RQ5バウンディングボックスの速度および運動ダイナミクスをモデル化することで、意図予測の精度がどの程度向上するか?

主な発見

  • 提案手法はJAADデータセットにおいて最先端の性能を達成し、歩行者意図予測の分野で先行研究を上回った。
  • 短期予測(入力0.3秒、出力0.6秒)において、ADEが10.22ピクセル、AIOUが73.2%を達成し、バウンディングボックス予測の高精度を示した。
  • 1920×1080解像度下でADEが9ピクセルにまで低下し、誤差は1%未満にとどまり、中心位置の精度が極めて高いことを示した。
  • 短期シーケンスにおいてFIOUスコアが62.8%を記録したことで、バウンディングボックスの中心位置と寸法の両方の予測が正確であることが確認された。
  • 単純な構造であるにもかかわらず、前例となる手法よりも2倍以上高速に動作し、性能を維持または向上させた。
  • アブレーションスタディの結果、マルチタスク学習により、特に移動する車両や静止している歩行者といった複雑な状況下でも、有用な共有表現が両ヘッドの性能向上に寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。