Skip to main content
QUICK REVIEW

[論文レビュー] Improving Few-Shot User-Specific Gaze Adaptation via Gaze Redirection Synthesis

Yu Yu, Gang Liu|arXiv (Cornell University)|Apr 24, 2019
Gaze Tracking and Assistive Technology参考文献 46被引用数 7
ひとこと要約

本論文では、限られた参照眼画像から多様で現実的なトレーニングサンプルを生成するための、視線リダイレクト合成を用いた新規少数ショットユーザー固有の視線適応手法を提案する。合成データ上で事前学習された視線リダイレクトネットワークに自己教師型ドメイン適応を適用することで、たった9例のユーザー固有のサンプルでも、ColumbiaGazeおよびMPIIGazeデータセットにおいて標準的な微調整やドメイン適応ベースラインを上回る視線推定精度を達成する。

ABSTRACT

As an indicator of human attention gaze is a subtle behavioral cue which can be exploited in many applications. However, inferring 3D gaze direction is challenging even for deep neural networks given the lack of large amount of data (groundtruthing gaze is expensive and existing datasets use different setups) and the inherent presence of gaze biases due to person-specific difference. In this work, we address the problem of person-specific gaze model adaptation from only a few reference training samples. The main and novel idea is to improve gaze adaptation by generating additional training samples through the synthesis of gaze-redirected eye images from existing reference samples. In doing so, our contributions are threefold: (i) we design our gaze redirection framework from synthetic data, allowing us to benefit from aligned training sample pairs to predict accurate inverse mapping fields; (ii) we proposed a self-supervised approach for domain adaptation; (iii) we exploit the gaze redirection to improve the performance of person-specific gaze estimation. Extensive experiments on two public datasets demonstrate the validity of our gaze retargeting and gaze estimation framework.

研究の動機と目的

  • 高コストなラベル付けのため、少数のラベル付き眼画像での正確なユーザー固有の視線推定の課題に対処すること。
  • 視線推定における合成画像と実画像の間の人物固有のバイアスおよびドメインシフトを低減すること。
  • 少数の参照サンプルから多様で現実的かつ正確にラベル付けされた視線指向眼画像を生成し、適応性能を向上させること。
  • 実画像と合成画像のペairedデータを必要としない自己教師型ドメイン適応手法を考案すること。
  • 視線リダイレクト合成が単なる微調整を上回る少数ショット視線適応を実現することを実証すること。

提案手法

  • 同一アイデンティティ、眼位置、頭部姿勢、照明を備えた大規模な合成眼画像ペアを用いて、視線リダイレクトネットワークを事前学習し、正確な逆ワープフィールドを予測する。
  • トレーニング中に合成画像のセグメンテーションマップを正則化として用いることで、空間的一致性を向上させる。
  • 実画像とペア化されていない状態でも、サイクル一貫性損失および視線リダイレクト損失を用いて、合成リダイレクト画像と実データを一致させる自己教師型ドメイン適応戦略を導入する。
  • リダイレクトされた画像を拡張データとして用い、汎用視線推定器をユーザー固有の適応に向け微調整する。
  • リダイレクトされたサンプルが現実的な外観と正確な視線の真値を保持していることを利用し、人物固有バイアスを低減する。
  • 明るさ補正のリファインメントモジュールを検討したが、色・照明の歪みにより性能が低下したため却下された。

実験結果

リサーチクエスチョン

  • RQ1少数の参照眼画像からの視線リダイレクト合成が、少数ショットユーザー固有の視線適応を改善できるか?
  • RQ2同一ペアで整列されたデータ上で事前学習することで、眼ランドマークを必要とせずに正確な視線リダイレクトが可能になるか?
  • RQ3実画像と合成画像の分布が異なる状況下で、自己教師型ドメイン適応が視線リダイレクト品質を向上させられるか?
  • RQ4視線推定精度の観点から、視線リダイレクト合成は標準的な微調整およびドメイン適応と比べてどのように異なるか?
  • RQ5リダイレクトされたサンプルは、外観および視線の一貫性において、どれほど実眼画像に近いか?

主な発見

  • 汎用視線推定器を9例のユーザー固有サンプルで微調整するだけで、汎用モデル単体を使用する場合に比べて視線推定精度が顕著に向上する。
  • 提案手法の視線リダイレクト合成により、ColumbiaGazeおよびMPIIGazeの両データセットで、標準的な微調整およびドメイン適応ベースラインを上回る適応性能が達成される。
  • サイクル一貫性損失および視線リダイレクト損失を用いた自己教師型ドメイン適応により、合成データと実データのドメインシフトが大きいColumbiaGazeでは特に性能向上が見られる。
  • 主観的評価では、66%の参加者が実画像とリダイレクト画像を信頼性を持って区別できず、生成されたサンプルの高品質なリアリズムを示している。
  • 実画像とリダイレクト画像を区別するための意思決定時間が、リダイレクト角度が小さいほど長くなることから、微細な変化は検出が難しいことが確認された。
  • 大きなリダイレクト角度における高品質なサンプル生成に限界があり、視線方向空間の全範囲をカバーできないことが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。