Skip to main content
QUICK REVIEW

[論文レビュー] LatentGaze: Cross-Domain Gaze Estimation through Gaze-Aware Analytic Latent Code Manipulation

Isack Lee, Jun‐Seok Yun|arXiv (Cornell University)|Sep 21, 2022
Gaze Tracking and Assistive Technology被引用数 5
ひとこと要約

LatentGaze は、GAN の逆問題による分離された潜在コードの視線に配慮した操作を活用して、視線関連特徴を分離する、新しいクロスドメイン視線推定手法を提案する。ターゲットドメインの画像を GAN ベースのエンコーダー・ジェネレータを用いてソースドメインに投影し、視線歪み損失を適用することで、複数のデータセット間での視線推定において最先端の精度を達成する。

ABSTRACT

Although recent gaze estimation methods lay great emphasis on attentively extracting gaze-relevant features from facial or eye images, how to define features that include gaze-relevant components has been ambiguous. This obscurity makes the model learn not only gaze-relevant features but also irrelevant ones. In particular, it is fatal for the cross-dataset performance. To overcome this challenging issue, we propose a gaze-aware analytic manipulation method, based on a data-driven approach with generative adversarial network inversion's disentanglement characteristics, to selectively utilize gaze-relevant features in a latent code. Furthermore, by utilizing GAN-based encoder-generator process, we shift the input image from the target domain to the source domain image, which a gaze estimator is sufficiently aware. In addition, we propose gaze distortion loss in the encoder that prevents the distortion of gaze information. The experimental results demonstrate that our method achieves state-of-the-art gaze estimation accuracy in a cross-domain gaze estimation tasks. This code is available at https://github.com/leeisack/LatentGaze/.

研究の動機と目的

  • 視線関連特徴の定義が曖昧であるため、クロスドメイン視線推定において不適切な特徴学習が生じる問題に対処する。
  • GAN ベースの画像変換を用いてターゲットドメインの画像をソースドメインにあわせることで、ドメインシフトを克服する。
  • エンコーダーにおいて視線歪み損失を導入することで、ドメイン適応中に視線情報が保持されることを保証する。
  • 潜在空間における視線関連成分の分離を活用することで、多様なデータセット間で頑健な視線推定を実現する。
  • 潜在コードの分析的操作により、モデルが判別力のある視線関連特徴に集中させることで、一般化性能を向上させる。

提案手法

  • ターゲットドメインの目の画像をソースドメインの分布に近づけるために、GAN ベースのエンコーダー・ジェネレータフレームワークを用い、ドメインシフトを低減する。
  • 潜在空間における視線関連成分を明確に抽出・強化するために、分析的潜在コード操作を適用する。
  • 画像変換中に視線関連情報が保持されるように、エンコーディングプロセス中に視線歪み損失を導入する。
  • GAN の逆問題の分離特性を活用して、アイデンティティや照明の変動から視線固有の特徴を分離する。
  • 翻訳されたソースドメインの画像に基づいて視線推定器を学習させ、これらが訓練分布と意味的に整合するようにする。
  • 再構成損失、対抗的損失、および視線固有の損失を組み合わせて、パイプライン全体をエンドツーエンドで最適化する。

実験結果

リサーチクエスチョン

  • RQ1分離された潜在コードに対する視線に配慮した操作は、クロスドメイン視線推定の性能向上に寄与するか?
  • RQ2GAN ベースの画像変換は、視線推定におけるドメインシフト低減にどの程度効果的か?
  • RQ3視線歪み損失は、ドメイン適応中に視線関連特徴の劣化をどの程度防止できるか?
  • RQ4潜在コードの分析的操作は、従来の特徴抽出手法を上回る性能を示せるか?
  • RQ5提案手法は、照明、ポーズ、アイデンティティの条件が異なる多様なデータセットに一般化可能か?

主な発見

  • 提案手法は、複数のクロスドメイン視線推定ベンチマークで最先端の性能を達成した。
  • 視線歪み損失は、画像変換中に視線関連特徴の劣化を顕著に低減した。
  • 潜在コード操作により、視線関連成分への焦点を明確にすることで、不適切な属性からの干渉を低減した。
  • GAN ベースの画像変換は、ターゲットドメインの画像をソースドメインの分布に効果的にあわせ、一般化性能を向上させた。
  • モデルは、照明やポーズ条件が異なる未学習のドメインを含む多様なデータセットにおいても頑健な性能を示した。
  • アブレーションスタディにより、視線歪み損失および視線に配慮した潜在コード操作の有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。