Skip to main content
QUICK REVIEW

[論文レビュー] MPIIGaze: Real-World Dataset and Deep Appearance-Based Gaze Estimation

Xucong Zhang, Yusuke Sugano|arXiv (Cornell University)|Nov 24, 2017
Gaze Tracking and Assistive Technology参考文献 64被引用数 10
ひとこと要約

本稿では、日常的なノートパソコン利用中に15名の被験者から収集された213,659枚のフルフェイス画像を含む大規模な現実世界データセットであるMPIIGazeを紹介する。このデータセットは、目の外見、照明、頭部姿勢に高いばらつきを示す。また、16層のVGG CNNを用いた深層外見ベースの gaze 推定手法であるGazeNetを提案し、従来の最先端手法と比較して、クロスデータセット評価において平均誤差を22%(10.8°)低減した。

ABSTRACT

Learning-based methods are believed to work well for unconstrained gaze estimation, i.e. gaze estimation from a monocular RGB camera without assumptions regarding user, environment, or camera. However, current gaze datasets were collected under laboratory conditions and methods were not evaluated across multiple datasets. Our work makes three contributions towards addressing these limitations. First, we present the MPIIGaze that contains 213,659 full face images and corresponding ground-truth gaze positions collected from 15 users during everyday laptop use over several months. An experience sampling approach ensured continuous gaze and head poses and realistic variation in eye appearance and illumination. To facilitate cross-dataset evaluations, 37,667 images were manually annotated with eye corners, mouth corners, and pupil centres. Second, we present an extensive evaluation of state-of-the-art gaze estimation methods on three current datasets, including MPIIGaze. We study key challenges including target gaze range, illumination conditions, and facial appearance variation. We show that image resolution and the use of both eyes affect gaze estimation performance while head pose and pupil centre information are less informative. Finally, we propose GazeNet, the first deep appearance-based gaze estimation method. GazeNet improves the state of the art by 22% percent (from a mean error of 13.9 degrees to 10.8 degrees) for the most challenging cross-dataset evaluation.

研究の動機と目的

  • 日常的な状況下で収集された大規模かつ多様なデータセットを提供することで、現実世界的・制約のない gaze 推定データセットの不足を補う。
  • 一部の画像に対して手動で注釈された顔面特徴点と虹彩中心位置を提供することで、gaze 推定手法のクロスデータセット評価を可能にする。
  • gaze 範囲、照明、個人の外見といった主な課題が gaze 推定性能に与える影響を調査する。
  • 現実世界の変動に一般化可能な深層外見ベースの gaze 推定手法を開発・評価する。
  • 複数のデータセットを用いた最先端手法の評価を通じて、制約のない gaze 推定のベンチマークを確立する。

提案手法

  • MPIIGaze データセットは、被験者が通常のノートパソコン利用中にランダムな間隔で提示されたスクリーン上の位置を注視するよう促される経験サンプリング法を用いて収集された。
  • データセットには、3次元 gaze 目標値に対応する213,659枚のフルフェイス RGB 画像が含まれており、照明、目の外見、頭部姿勢の現実的なばらつきが捉えられている。
  • 37,667枚の画像のサブセットに対して、6つの顔面特徴点(目と口の端)と虹彩中心位置が手動で注釈付けされ、クロスデータセット評価や関連タスクの支援がなされた。
  • GazeNet は、顔の外見特徴のみを用いて、眼領域画像から3次元 gaze 方向を回帰する16層のVGGスタイルの畳み込みニューラルネットワークである。頭部姿勢や特徴点の入力を明示的に使用しない。
  • モデルは、MPIIGaze、EYEDIAP、UT Multiview などの複数のデータセットで訓練・評価され、入力モalityおよびデータ分布に関する広範なアブレーションスタディが実施された。
  • 性能評価は、クロスデータセットおよび within-dataset 評価設定における平均角誤差(MAE)を用い、形状ベースおよび合成学習アプローチを含む最先端手法と比較した。

実験結果

リサーチクエスチョン

  • RQ1gaze 推定性能は、データセット内評価と比較して、現実世界のデータセット間評価においてどの程度劣化するか?
  • RQ2gaze 範囲、照明、個人の外見のばらつきが、制約のない gaze 推定における性能差にどの程度寄与しているか?
  • RQ3深層外見ベースの手法は、現実世界的・制約のない環境において、従来のモデルベースおよびハイブリッド手法を上回る性能を発揮できるか?
  • RQ4深層学習ベースの gaze 推定において、頭部姿勢や虹彩中心位置の情報が現実世界のデータに対してどの程度有効な補助入力となるか?
  • RQ5合成データを事前学習に用いることで、実世界のテストデータへの一般化性能にどのような影響を与えるか?

主な発見

  • 提案された GazeNet 手法は、最も挑戦的なクロスデータセット評価において、平均角誤差を13.9°から10.8°に低減し、従来の最先端手法と比較して22%の改善を達成した。
  • 照明条件がクロスデータセット評価における性能差の35%を占めており、現実世界の gaze 推定においてその重要性が浮き彫りになった。
  • 個人の外見のばらつきが性能差の40%を占めており、一般化のための多様なトレーニングデータの重要性が強調された。
  • gaze 範囲の制限が性能差の25%を占めており、より広いカバー範囲でのトレーニングが耐性向上に寄与することを示唆した。
  • 頭部姿勢や虹彩中心位置の情報を入力に追加しても、性能向上はわずかにしか得られず、制約のない環境ではその有用性が限定的であることが示された。
  • データセット内評価とクロスデータセット評価の間には顕著な性能差があり、従来の評価において顕著なドメインシフトとデータセットバイアスが存在することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。