Skip to main content
QUICK REVIEW

[論文レビュー] Driver Gaze Region Estimation Without Using Eye Movement

Lex Fridman, Philipp Langhans|arXiv (Cornell University)|Jul 16, 2015
Gaze Tracking and Assistive Technology参考文献 13被引用数 11
ひとこと要約

本稿では、眼帯付録画を用いず、顔の特徴点位置のみを用いてリアルタイムでドライバーの注視領域を推定するシステムを提案する。11 Hzの速度で91.4%の精度を達成し、頭部姿勢の配置を6つの注視領域に分類する。本手法は、被験者固有のモデルと信頼度に基づく意思決定の刈り込みを活用し、グローバルモデルに比べて顕著に性能を向上させる。

ABSTRACT

Automated estimation of the allocation of a driver's visual attention may be a critical component of future Advanced Driver Assistance Systems. In theory, vision-based tracking of the eye can provide a good estimate of gaze location. In practice, eye tracking from video is challenging because of sunglasses, eyeglass reflections, lighting conditions, occlusions, motion blur, and other factors. Estimation of head pose, on the other hand, is robust to many of these effects, but cannot provide as fine-grained of a resolution in localizing the gaze. However, for the purpose of keeping the driver safe, it is sufficient to partition gaze into regions. In this effort, we propose a system that extracts facial features and classifies their spatial configuration into six regions in real-time. Our proposed method achieves an average accuracy of 91.4% at an average decision rate of 11 Hz on a dataset of 50 drivers from an on-road study.

研究の動機と目的

  • 眩光、遮蔽、反射などの現実世界の制約により、眼帯付録画に依存しない、耐障害性が高く低コストなドライバーの注視領域推定システムの開発。
  • 顔の特徴点から得られる頭部姿勢のみで、ドライバーディストラクション検出に十分な精度で注視領域を予測できるかどうかの調査。
  • 被験者固有のモデルと信頼度に基づく意思決定フィルタリングが、注視領域分類の性能向上にどの程度有効であるかの評価。
  • このようなシステムを、一般消費者用ハードウェア上でリアルタイムに展開可能かどうかの検証。

提案手法

  • 本システムは、回帰木に基づく顔のアラインメントアルゴリズムを用いて、リアルタイムで2次元の顔の特徴点を推定する。
  • これらの特徴点の空間的配置を、ランダムフォレスト分類器を用いて6つの事前に定義された注視領域のいずれかに分類する。
  • 被験者固有のモデルは、1人のドライバーあたり各注視領域クラスに対して3秒間のデータを用いて学習される。これにより、頭部と目の動きの個人差を捉える。
  • 信頼度に基づく意思決定の刈り込みが適用される:しきい値を超える信頼度を持つ分類結果のみが保持され、精度は向上するが、意思決定頻度は低下する。
  • パイプラインは1コアのIntel i5プロセッサ上で1フレームあたり10ms未満で実行され、リアルタイム動作が可能である。
  • 本システムは明示的な頭部姿勢ベクトルの推定を回避し、顔の幾何学的特徴を直接注視領域ラベルにマッピングする。

実験結果

リサーチクエスチョン

  • RQ1顔の特徴点の配置のみで、眼の動きや虹彩の追跡を一切用いず、ドライバーの注視領域を高い精度で予測できるか?
  • RQ2グローバルモデルと被験者固有のモデルの両者を比較した場合、注視領域分類の性能にどのような差が生じるか?
  • RQ3分類意思決定に対する信頼度に基づくフィルタリングが、注視領域推定の精度をどの程度向上させるか?
  • RQ4頭部の動きと注視の関係は、個人間でどのように異なるか、また、同じ個人が異なる走行条件下でどのように変化するか?

主な発見

  • 提案されたシステムは、顔の特徴点データのみを用いて、6つの注視領域に分類する際、平均91.4%の精度を達成し、11 Hzの意思決定レートを実現した。
  • 被験者固有のモデルは、グローバルモデルの44.1%から65.0%まで精度を向上させ、頭部と目の動きの個人差が顕著であることを示した。
  • 信頼度に基づく刈り込みを適用することで、6クラス分類問題では91.4%、2クラス分類問題では92.5%の精度に向上したが、平均意思決定インターバルはわずかに増加した。
  • 2クラス分類問題(「走行関連」対「センター・スタック」注視)は6クラス分類よりも高い精度を示し、より単純な区別はより信頼性高く予測可能であることを示した。
  • 性能はドライバー間で顕著に異なり、同じドライバーでも異なる走行条件下で変動するため、パーソナライゼーションの重要性が浮き彫りになった。
  • パイプライン全体が一般消費者用ハードウェア上でリアルタイムに動作し、各コンponent(顔検出、アラインメント、分類)が1フレームあたり10ms未満で完了した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。