Skip to main content
QUICK REVIEW

[論文レビュー] Highly accurate gaze estimation using a consumer RGB-depth sensor

Reza Shoja Ghiass, Ognjen Arandjelović|arXiv (Cornell University)|Apr 5, 2016
Gaze Tracking and Assistive Technology参考文献 28被引用数 4
ひとこと要約

本稿では、Microsoft Kinectなどのコンsumer用RGB-Dセンサーを用いた、非常に高精度な視線推定手法を提示する。本手法は、まず、速度と精度の両立を図るための適応的最適化戦略を用いて、深度データに個別化された3次元可塑的顔モデルをフィッティングする。次に、一貫性のある目の外見特徴抽出を可能にするために、顔を前面視点に正規化する。最後に、これらの合成前面眼画像から視線方向を回帰することで、EYEDIAPベンチマークにおいて従来の最先端手法を30%以上上回る優れた性能を達成する。

ABSTRACT

Determining the direction in which a person is looking is an important problem in a wide range of HCI applications. In this paper we describe a highly accurate algorithm that performs gaze estimation using an affordable and widely available device such as Kinect. The method we propose starts by performing accurate head pose estimation achieved by fitting a person specific morphable model of the face to depth data. The ordinarily competing requirements of high accuracy and high speed are met concurrently by formulating the fitting objective function as a combination of terms which excel either in accurate or fast fitting, and then by adaptively adjusting their relative contributions throughout fitting. Following pose estimation, pose normalization is done by re-rendering the fitted model as a frontal face. Finally gaze estimates are obtained through regression from the appearance of the eyes in synthetic, normalized images. Using EYEDIAP, the standard public dataset for the evaluation of gaze estimation algorithms from RGB-D data, we demonstrate that our method greatly outperforms the state of the art.

研究の動機と目的

  • 低コストでコンsumer用のRGB-Dセンサーを用いた視線推定において、高精度かつリアルタイム性能を達成する挑戦に応えること。
  • ユーザーキャリブレーションを必要とする、単にRGBデータに依存する従来の視線推定手法の限界を克服すること。
  • 深度データと個別化された3次元可塑的顔モデルを用いた、頑健で高速かつ高精度なヘッドポーズ推定技術を開発すること。
  • 合成前面レンダリングによるヘッドポーズ正規化を通じて、自然なヘッドムーブメント下でも正確な視線推定を可能にすること。
  • 正規化された目の外見画像に対する外見ベースの回帰を活用することで、一般化性能を向上させ、視線推定誤差を低減すること。

提案手法

  • 反復的最近接点(ICP)に類似した最適化フレームワークを用いて、深度データに個別化された3次元可塑的顔モデルをフィッティングする。
  • 精度と速度のバランスを取るための項の組み合わせとしてのフィッティング目的関数を定式化し、最適化中に重みを適応的に変更することで、性能と効率の両立を図る。
  • 適合した3次元顔モデルを再レンダリングして合成前面画像として生成することで、ヘッドポーズのばらつきを除去するポーズ正規化を実施する。
  • 合成前面画像から目の外見特徴を抽出し、視線推定の回帰に使用する。
  • 正規化された目の外見特徴を用いて、k-NNまたは適応的線形回帰を用いて視線回帰モデルを学習する。
  • EYEDIAPデータセットを用いて、ヘッドスタビライゼーションおよび自然なヘッドムーブメントの両条件での評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1個別化された3次元可塑的顔モデルを用いた深度データからのヘッドポーズ推定において、どのようにして高精度と高速性を同時に達成できるか?
  • RQ2自然なヘッドムーブメントが存在する状況下で、合成前面レンダリングによるポーズ正規化が視線推定精度に与える影響は何か?
  • RQ3コンシューマー用RGB-Dセンサーを用いた場合、提案手法は最先端の視線推定手法と比べてどのように差をつけることができるか?
  • RQ4正規化された目の外見画像に対する外見ベースの回帰は、従来のアプローチと比較して、顕著に視線推定誤差を低減できるか?
  • RQ5自然なヘッドムーブメント下でも、本手法は頑健な性能を維持できるか。これは、実世界のHCIアプリケーションにおける主な課題である。

主な発見

  • EYEDIAPデータセットを用いたヘッドスタビライゼーション条件下で、適応的線形回帰を用いることで、平均視線方向推定誤差を7.2°にまで低減し、前回の最先端手法(10.1°)と比較して28.7%の改善を達成した。
  • 自然なヘッドムーブメント条件下でも、適応的線形回帰を用いることで平均誤差が9.6°にまで低下し、前回の最先端手法(14.9°)と比較して35.6%の低減を達成した。
  • k-NN回帰を用いても、ヘッドスタビライゼーション条件下で22%の誤差低減(7.7° vs. 9.9°)を達成しており、一貫した優位性を示した。
  • 本手法はヘッドムーブメントに対して著しく頑健であり、誤差増加率が15%(7.7°から8.9°)にとどまる一方、前回の最先端手法は65%の増加(9.9°から16.3°)を示した。
  • 適応的最適化戦略により、リアルタイムで高精度な3次元顔モデル適合が可能となり、実用的でリアルタイムな人間-コンピュータインタラクション応用に適していることがわかった。
  • ポーズ正規化後に合成前面眼画像を用いることで、視線回帰に適した一貫性があり、識別性の高い特徴が得られ、これが性能向上に直接寄与している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。