Skip to main content
QUICK REVIEW

[論文レビュー] Appearance-Based 3D Gaze Estimation with Personal Calibration.

Erik van der Linden, Jonas Sjöstrand|arXiv (Cornell University)|Jul 2, 2018
Gaze Tracking and Assistive Technology参考文献 17被引用数 12
ひとこと要約

本稿では、個人のキャリブレーションを深層学習モデルに統合する外観ベースの3次元視線推定手法を提案する。3つのパラメータを1眼あたりに設定した6つの眼固有パラメータを用いることで、従来手法と比較して精度が2.2–2.5倍向上する。3次元視線線(原点と方向)を予測することで、一般化性能が向上し、実際のデータに3次元視線が不十分に制限されている状況下でも、MPIIGazeデータセットにおいて個人特化型ベースラインを上回る優れた性能を達成する。

ABSTRACT

We propose a way to incorporate personal calibration into a deep learning model for video-based gaze estimation. Using our method, we show that by calibrating six parameters per person, accuracy can be improved by a factor of 2.2 to 2.5. The number of personal parameters, three per eye, is similar to the number predicted by geometrical models. When evaluated on the MPIIGaze dataset, our estimator performs better than person-specific estimators. To improve generalization, we predict gaze rays in 3D (origin and direction of gaze). In existing datasets, the 3D gaze is underdetermined, since all gaze targets are in the same plane as the camera. Experiments on synthetic data suggest it would be possible to learn accurate 3D gaze from only annotated gaze targets, without annotated eye positions.

研究の動機と目的

  • ビデオベースの視線推定精度を、個人のキャリブレーションを深層学習モデルに統合することで向上させること。
  • 2次元視線ベクトルの代わりに3次元視線線(原点と方向)を予測することで、正確な眼位置のアノテーションへの依存度を低減すること。
  • 眼位置のアノテーションを必要とせず、注釈付きの視線ターゲットからのみ3次元視線表現を学習することで、モデルの一般化性能を向上させること。
  • 現実世界のデータセットが視線ターゲットを1つの平面に制限している場合でも、3次元視線推定が有効に学習可能であることを示すこと。

提案手法

  • モデルは単眼動画入力を用いて、深層ニューラルネットワークにより3次元視線線(原点と方向)を予測する。これにより、2次元視線推定よりも優れた一般化性能が得られる。
  • 個人のキャリブレーションは、6つの学習可能なパラメータ(1眼あたり3つ)を用いて実装され、モデルの内部表現を個々の眼の特徴に適応させる。
  • ネットワークは、視線ターゲットが1つの平面に制限されているMPIIGazeデータセットで訓練される。これは、現実世界のデータ制限を模倣するものである。
  • 合成データの実験により、眼位置のアノテーションを必要とせず、注釈付きの視線ターゲットのみで正確な3次元視線推定が可能であることが示された。
  • 3次元視線線予測はエンドツーエンドで最適化され、モデルがデータから幾何的制約を暗黙的に学習できるようにしている。

実験結果

リサーチクエスチョン

  • RQ1個人のキャリブレーションは、深層学習モデルにおける3次元視線推定精度を顕著に向上させることができるか?
  • RQ2眼位置のアノテーションを一切必要とせず、注釈付きの視線ターゲットのみから3次元視線推定をどの程度学習できるか?
  • RQ33次元視線線(原点と方向)を予測することで、2次元視線ベクトル予測と比較して一般化性能がどのように向上するか?
  • RQ4訓練データがすべての視線ターゲットを1つの平面に制限している場合でも、深層学習モデルが高精度な3次元視線推定を達成できるか?

主な発見

  • 提案手法は、キャリブレーションを行わないベースラインと比較して、視線推定精度を2.2~2.5倍向上させた。
  • MPIIGazeデータセットにおいて、共有アーキテクチャに個人のキャリブレーションを組み込んだにもかかわらず、個人特化型推定器を上回る性能を示した。
  • 合成データの実験結果から、眼位置のアノテーションを必要とせず、注釈付きの視線ターゲットのみで正確な3次元視線推定が可能であることが示された。
  • 3次元視線線の予測により、モデルがデータから幾何的制約を暗黙的に学習できるため、一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。