Skip to main content
QUICK REVIEW

[論文レビュー] EyeNet: A Multi-Task Network for Off-Axis Eye Gaze Estimation and User Understanding

Zhengyang Wu, Srivignesh Rajendran|arXiv (Cornell University)|Aug 24, 2019
Gaze Tracking and Assistive Technology参考文献 35被引用数 9
ひとこと要約

EyeNet は、VR/MR システムにおけるオフアクシスの目の画像から、眼の注視方向、セグメンテーション、瞬き検出、感情表現、および光の反射(グレイン)位置を統合的に推定するマルチタスク深層ニューラルネットワークである。タスク間で特徴を共有し、手動ラベルとモデルベースの監視を併用することで、12ms の推論時間で最先端の精度を達成し、手作業で設計された幾何学的パイプラインの必要性を排除した。

ABSTRACT

Eye gaze estimation and simultaneous semantic understanding of a user through eye images is a crucial component in Virtual and Mixed Reality; enabling energy efficient rendering, multi-focal displays and effective interaction with 3D content. In head-mounted VR/MR devices the eyes are imaged off-axis to avoid blocking the user's gaze, this view-point makes drawing eye related inferences very challenging. In this work, we present EyeNet, the first single deep neural network which solves multiple heterogeneous tasks related to eye gaze estimation and semantic user understanding for an off-axis camera setting. The tasks include eye segmentation, blink detection, emotive expression classification, IR LED glints detection, pupil and cornea center estimation. To train EyeNet end-to-end we employ both hand labelled supervision and model based supervision. We benchmark all tasks on MagicEyes, a large and new dataset of 587 subjects with varying morphology, gender, skin-color, make-up and imaging conditions.

研究の動機と目的

  • オフアクシスのヘッドマウントディスプレイにおける、同時に眼の注視方向推定と意味的ユーザー理解を実現する統合的深層学習フレームワークの開発。
  • グレインおよび虹彩検出に向けた手作業で設計されたコンピュータビジョンパイプラインへの依存を排除し、エンド・トゥ・エンドの表現を学習する。
  • 異種のタスク間での共有特徴学習を通じて、リソース制限のある AR/MR 環境における耐障害性と効率性を向上させる。
  • 性別、肌の色、撮影条件の変動を含む多様なバリエーションを持つ大規模なデータセットを用いたパフォーマンスのベンチマーク。
  • 単一で計算効率の良いネットワークを用いて、注視方向、瞬き、表情、目の解剖学的構造を正確かつリアルタイムに推定することを可能にする。

提案手法

  • EyeNet は、ResNet50 をベースにしたマルチタスク学習アーキテクチャを採用し、眼のセグメンテーション、瞬き検出、感情表現分類、赤外光の反射(IR glint)検出、および虹彩/角膜中心推定を同時に最適化する。
  • ネットワークは、眼の幾何学的構造から導出されるモデルベースの監視と、手動ラベルの両方を用いて、角膜中心および注視方向推定の精度を向上させる。
  • 共有バックボーンネットワークが特徴を抽出し、その後、複数の出力に分岐することで、パラメータ共有と計算効率を実現する。
  • モデルは、多様な身体的特徴、性別、肌の色、撮影条件を持つ 587 人の被験者から構成される新しいデータセット「MagicEyes」上でエンド・トゥ・エンドに訓練されている。
  • 後処理では、ネットワークからの初期推定値を用いて、標準的な勾配降下法最適化を実行し、3次元の注視方向推定を精緻化する。
  • 推論速度の最適化(12ms/フォワードパス)を実現するため、160x120 の入力解像度と ResNet50 を使用し、AR/MR ハードウェアへのデプロイを可能にしている。

実験結果

リサーチクエスチョン

  • RQ11つの深層ニューラルネットワークが、オフアクシスの眼の注視方向推定とユーザー理解という、多様なタスクを効果的に同時に解決できるか?
  • RQ2外観ベースのタスクと幾何学的タスクの間で共有表現を学習することで、注視方向推定の耐障害性と精度が向上するか?
  • RQ3眼の幾何学的構造から導出されるモデルベースの監視は、手作業で設計されたヒューリスティクスを必要とせずに、注視方向推定の精度を向上させられるか?
  • RQ4眼領域のデータのみを用いた場合、マルチタスク学習が瞬き検出および感情表現分類のパフォーマンスにどのように影響を与えるか?
  • RQ5統合されたネットワークは、リアルタイムの AR/MR 応用において、高い精度を維持しつつ、計算負荷をどの程度低減できるか?

主な発見

  • 25 人の被験者から構成されるテストセットにおいて、瞬き検出の偽陽性率は 1.24%、偽陰性率は 4.01% であり、先行研究(8.3% および 16.7%)を上回る性能を示した。
  • 感情表現分類の全体精度は 92.75% を達成し、ニュートラルクラスでは 94.92%、ハッピークラスでは 93.74% の精度を示した。
  • GPU 上で 83fps(平均 12ms の推論時間)で実行可能であり、AR/MR デバイスにおけるリアルタイムデプロイに適している。
  • モデルベースの監視の導入により、高品質な角膜中心推定が可能になり、注視方向推定の精度が顕著に向上した。
  • マルチタスクアーキテクチャのおかげで、手作業で設計されたコンponents の必要性が低減され、保守性とスケーラビリティが向上した。
  • MagicEyes データセットを用いた検証により、性別、肌の色、化粧の有無の変動を含む多様なデモグラフィック要因に対しても、優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。