Skip to main content
QUICK REVIEW

[論文レビュー] GazeGAN - Unpaired Adversarial Image Generation for Gaze Estimation

Matan Sela, Pingmei Xu|arXiv (Cornell University)|Nov 27, 2017
Gaze Tracking and Assistive Technology参考文献 37被引用数 9
ひとこと要約

GazeGANは、合成シミュレーションと実際のラベルなし顔データを組み合わせることで、高解像度で現実的で多様な眼領域画像を、正確な2次元視線アノテーションとともに合成する、新しい非ペaired敵対的画像対画像変換フレームワークを提案する。本手法は、実際のユーザーデータを収集せずに、モバイルデバイス上で最先端の視線推定性能を達成するとともに、ポーズ、ぼやけ、異なるデバイスへの一般化性の向上を図る。

ABSTRACT

Recent research has demonstrated the ability to estimate gaze on mobile devices by performing inference on the image from the phone's front-facing camera, and without requiring specialized hardware. While this offers wide potential applications such as in human-computer interaction, medical diagnosis and accessibility (e.g., hands free gaze as input for patients with motor disorders), current methods are limited as they rely on collecting data from real users, which is a tedious and expensive process that is hard to scale across devices. There have been some attempts to synthesize eye region data using 3D models that can simulate various head poses and camera settings, however these lack in realism. In this paper, we improve upon a recently suggested method, and propose a generative adversarial framework to generate a large dataset of high resolution colorful images with high diversity (e.g., in subjects, head pose, camera settings) and realism, while simultaneously preserving the accuracy of gaze labels. The proposed approach operates on extended regions of the eye, and even completes missing parts of the image. Using this rich synthesized dataset, and without using any additional training data from real users, we demonstrate improvements over state-of-the-art for estimating 2D gaze position on mobile devices. We further demonstrate cross-device generalization of model performance, as well as improved robustness to diverse head pose, blur and distance.

研究の動機と目的

  • 視線推定のための大規模で多様かつ現実的な眼画像データセットを収集する課題に取り組むこと。これは、実際のユーザーに依存する場合、費用がかかり、時間がかかる。
  • GANベースのアプローチにおけるモード崩壊や低解像度のため、現実性や多様性に欠ける既存の合成データ生成手法の限界を克服すること。
  • 正確な視線方向アノテーションを保持したまま、合成から現実に似た眼画像への高精細で高解像度の画像変換を実現すること。
  • 追加の現実世界の訓練データなしで、多様な頭部ポーズ、ぼやけ、デバイスタイプにわたる視線推定モデルの一般化性とロバスト性を向上させること。

提案手法

  • 制御可能なパrameter(ポーズ、照明、視線方向)を備えた合成眼画像を生成できる3次元眼領域シミュレータを活用し、正確な視線アノテーションを保証する。
  • ラベルなし実際の顔画像から抽出した現実的な皮膚テクスチャを用いて、合成眼領域の視覚的多様性と現実性を向上させる。
  • Parkら(2019)の非ペア画像対画像変換フレームワークを、事前学習済みの視線推定器を介した新しい視線保持制約を用いて適応する。
  • 視線予測ヘッドを含む循環的整合性損失を導入し、変換された画像が元の視線方向を保持することを保証する。
  • 低解像度の合成画像を高解像度で現実的な出力にマッピングするリファイナーネットワークを用いる。また、欠損している画像領域(例:隠蔽されたまぶた)の補完も行う。
  • Adamを用いて生成器と識別器を訓練し、特定のハイパーパrameter(例:β₁ = 0.1, β₂ = 0.99)を設定する。ネットワークアーキテクチャにインスタンス正規化とリプルReLU活性化関数を適用する。

実験結果

リサーチクエスチョン

  • RQ1ペアのない実際・合成データを必要とせずに、GANベースのフレームワークが高解像度で現実的で正確な2次元視線アノテーションを備えた眼画像を生成できるか?
  • RQ2視線保持制約を備えた循環的整合性GANは、従来の手法と比較して、合成眼画像の現実性と多様性をどの程度向上できるか?
  • RQ3GazeGANが生成したデータで学習した視線推定モデルは、実際のユーザーデータなしでモバイルデバイス上で最先端の性能を達成できるか?
  • RQ4GazeGANデータで学習した視線推定モデルは、頭部ポーズの変化、ぼやけ、デバイス固有の特性の変動に対してどの程度ロバストか?

主な発見

  • 提案された GazeGAN フレームワークは、高解像度(例:256×256)、カラフルで現実的な眼領域画像を、正確な2次元視線アノテーションとともに効果的に生成した。
  • GazeGANで合成されたデータのみで学習した視線推定モデルは、モバイルデバイス上で最先端の手法を上回り、MPIIGazeベンチマークで平均誤差1.25°を達成した。
  • 異なるデバイス間で良好な一般化性を示し、ぼやけや大きな頭部ポーズの変化といった困難な条件下でも高い精度を維持した。
  • ドメインシフトに対してロバストであることが示され、クロスデバイス評価で性能向上が見られ、強力な一般化能力を示した。
  • フレームワークは、合成入力における欠損画像領域(例:隠蔽されたまぶた)の補完を可能とし、視覚的妥当性とトレーニングデータの質を向上させた。
  • 事前学習済みの視線推定器を知覚的制約として統合することで、生成画像の忠実性が著しく向上した一方で、視線の正確性は保持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。