Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Driver Attention in Critical Situations

Ye Xia, Danqing Zhang|arXiv (Cornell University)|Nov 17, 2017
Gaze Tracking and Assistive Technology参考文献 4被引用数 5
ひとこと要約

本論文は、臨床的で重要なドライブシナリオにおけるドライバーの注目行動を高品質かつスケーラブルにアノテート可能な、新規のラボ内ドライバー注目度収集プロトコルと、Berkeley DeepDrive Attention (BDD-A) データセットを紹介している。人間の注視行動に基づき、注視の重要度が高いフレームを優先する人間重み付きサンプリング(HWS)を用いることで、著者らはドライバー注目度を予測する深層学習モデルを訓練した。その結果、人間と同等の認識能力を示し、実車両内のデータに対しても効果的に一般化する、最先端の性能を達成した。

ABSTRACT

Robust driver attention prediction for critical situations is a challenging computer vision problem, yet essential for autonomous driving. Because critical driving moments are so rare, collecting enough data for these situations is difficult with the conventional in-car data collection protocol---tracking eye movements during driving. Here, we first propose a new in-lab driver attention collection protocol and introduce a new driver attention dataset, Berkeley DeepDrive Attention (BDD-A) dataset, which is built upon braking event videos selected from a large-scale, crowd-sourced driving video dataset. We further propose Human Weighted Sampling (HWS) method, which uses human gaze behavior to identify crucial frames of a driving dataset and weights them heavily during model training. With our dataset and HWS, we built a driver attention prediction model that outperforms the state-of-the-art and demonstrates sophisticated behaviors, like attending to crossing pedestrians but not giving false alarms to pedestrians safely walking on the sidewalk. Its prediction results are nearly indistinguishable from ground-truth to humans. Although only being trained with our in-lab attention data, the model also predicts in-car driver attention data of routine driving with state-of-the-art accuracy. This result not only demonstrates the performance of our model but also proves the validity and usefulness of our dataset and data collection protocol.

研究の動機と目的

  • 稀で重要なドライブイベントにおけるラボ内ドライバー注目度データの不足とバイアスを解消すること。
  • クラウドソーシングされたドライブ動画と複数の観察者による注視度平均化を用いて、実世界のドライバー注目度を模倣する、スケーラブルなラボ内データ収集プロトコルの開発。
  • 注目度の高いフレームを重点的に収集する、大規模な新規ドライバー注目度データセット(BDD-A)の作成。特にブレーキングイベントに焦点を当て、高い相互作用密度を持つ。
  • 人間の注視パターンに基づき、注視の重要度に応じてフレームの重みを再設定する人間重み付きサンプリング(HWS)を導入することで、臨床的瞬間におけるモデルの一般化性能と性能を向上。
  • ラボ内データと実車両内データの両方で、最先端の性能を達成または上回るドライバー注目度予測モデルの訓練。

提案手法

  • 新規のラボ内ドライバー注目度収集プロトコルの提案:複数の観察者にクラウドソーシングされたドライブ動画を提示し、模擬ドライブタスクを実施。観察者の注視反応を平均化して、複数焦点の注視マップを生成。
  • 大規模なクラウドソーシングドライブ動画データセットから抽出したブレーキングイベントのクリップを基に、ラボ内での人間の注視データでアノテートされた、Berkeley DeepDrive Attention (BDD-A) データセットを構築。
  • 人間重み付きサンプリング(HWS)の導入:人間の注視パターンを用いて、注視の要求が高いフレーム(特に臨床的イベント時)を特定し、それらに高いトレーニング重みを割り当てる。
  • BDD-A データセットと HWS を用いて、全体の精度と臨床的瞬間の性能の両方を最適化した損失関数を用いて、ドライバー注目度予測のための深層ニューラルネットワークを訓練。
  • 高速道路の走行状況に適応させるために、ラボ内で30分分の注視データを含む、小規模な in-car DR(eye)VE データセットの一部を微調整。
  • 標準指標(発散度、CC、NSS、AUC)と人間による判断研究を用いて、モデルの性能を評価。モデルの予測結果と真値の注視マップを比較。

実験結果

リサーチクエスチョン

  • RQ1複数の観察者から収集したラボ内、第三者視点の注視データは、熟練ドライバーが臨床的状況で注視すべき場所を信頼性高く再現できるか?
  • RQ2均一なサンプリングと比較して、人間重み付きサンプリング(HWS)は、稀でリスクの高いドライブイベントにおけるモデル性能を向上させるか?
  • RQ3完全にラボ内での注視データのみで訓練されたモデルは、実世界の車両内ドライブシナリオにおいても高い正確性で一般化できるか?
  • RQ4モデルの性能は、人間の注視度とどの程度類似しているか?特に、人間の注視度との認識的類似性の観点から、最先端モデルと比較してどうか?
  • RQ5モデルの予測は、安全な歩道上の歩行者を無視しながら、道路を横切る歩行者に注目するという、正確なリスク認識を反映しているか?

主な発見

  • 提案されたラボ内データ収集プロトコルにより生成された注視マップは、車両内データよりも最適なドライバー注視度をより的確に反映していると評価された。41%の参加者が、モデルの予測結果をラボ内の人間の注視マップよりも好むと回答した(p = 4×10⁻⁵)。
  • HWS 法は、臨床的フレームにおけるモデル性能を顕著に向上させ、均一なサンプリングと比較して、稀でリスクの高いイベントの精度向上が顕著に見られた。
  • 微調整にわずか30分分の追加ラボ内注視データを用いた後、DR(eye)VE 車両内データセットにおいても、モデルは最先端の性能を達成した。KL 発散度と相関係数の95%信頼区間が重複していた。
  • モデルは洗練された注視行動を示し、道路を横切る歩行者に注目しながら、歩道上の歩行者に対して誤検出を回避していた。
  • 人間の判断によると、モデルの予測結果は真値の人間注視マップとほとんど区別がつかないほど高精度な認識的忠実性を示していた。
  • 微調整済みモデルは、DR(eye)VE モデルと比較して、車両、歩行者、自転車乗りといった重要なカテゴリの注視オブジェクトの割合が顕著に高くなっており、ラボ内の人間の注視度とより一致していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。