[論文レビュー] PureGaze: Purifying Gaze Feature for Generalizable Gaze Estimation
PureGaze は、自己対抗学習方式を用いて照度や個人差などの視線に関係のない要因を除去することで、視線特徴を洗練する、プラグアンドプレイなドメイン一般化フレームワークを提案する。視線保持と顔画像再構成を同時に最適化することで、ターゲットドメインデータを必要とせず、未観測のデータセット間で顕著に一般化性能を向上させ、最先端のクロスドメイン性能を達成する。
Gaze estimation methods learn eye gaze from facial features. However, among rich information in the facial image, real gaze-relevant features only correspond to subtle changes in eye region, while other gaze-irrelevant features like illumination, personal appearance and even facial expression may affect the learning in an unexpected way. This is a major reason why existing methods show significant performance degradation in cross-domain/dataset evaluation. In this paper, we tackle the cross-domain problem in gaze estimation. Different from common domain adaption methods, we propose a domain generalization method to improve the cross-domain performance without touching target samples. The domain generalization is realized by gaze feature purification. We eliminate gaze-irrelevant factors such as illumination and identity to improve the cross-domain performance. We design a plug-and-play self-adversarial framework for the gaze feature purification. The framework enhances not only our baseline but also existing gaze estimation methods directly and significantly. To the best of our knowledge, we are the first to propose domain generalization methods in gaze estimation. Our method achieves not only state-of-the-art performance among typical gaze estimation methods but also competitive results among domain adaption methods. The code is released in https://github.com/yihuacheng/PureGaze.
研究の動機と目的
- 照度や個人差などのドメインシフト要因によって引き起こされる視線推定モデルの性能低下を是正すること。
- ターゲットドメインデータやラベルにアクセスできない状況でも、モデルのロバスト性を向上させるドメイン一般化手法を開発すること。
- 既存の視線推定モデルに統合可能な、プラグアンドプレイなモジュールを設計し、視線に関連する特徴を視覚的要因から洗練させること。
- 視線に関係のない属性を明示的に定義せずとも、特徴を暗黙的に洗練させることで、多様な環境間でより良い一般化を実現すること。
提案手法
- 本手法は、視線に関連する特徴の保持と、元の顔画像の再構成という2つの競合する目的を持つ自己対抗フレームワークを採用する。
- 視線保持タスクは、特徴マップ上に2層のMLPを用いた標準的な視線推定ヘッドとして実装される。
- 再構成タスクは、洗練された特徴マップから入力画像を再構成する敵対的オートエンコーダとして実装される。
- SA-Module(自己対抗モジュール)は、特徴マップのチャネル数を段階的に減少させる5層の残差ブロックであり、入力解像度と空間的に整合した特徴マップを出力するように設計されている。
- 全体の損失関数は、視線推定損失と再構成損失をハイパーパrameter α=1、β=1、k=0.75 を用いて組み合わせており、注釈マップの分散 σ²=20 ピクセルである。
- このフレームワークはプラグアンドプレイであり、ResNet-18 などの既存の視線推定バックボーンにアーキテクチャの変更なしに統合可能である。
実験結果
リサーチクエスチョン
- RQ1ターゲットドメインデータにアクセスしない状況でも、視線推定モデルが未観測ドメイン間で一般化性能を向上させられるか。
- RQ2自己対抗フレームワークが、照度や個人差といった視線に関係のない要因を除去することで、視線特徴をどれほど洗練できるか。
- RQ3特徴の洗練が、極端な照明条件下や多様なデータセットにおいて、測定可能な性能向上をもたらすか。
- RQ4提案されたプラグアンドプレイモジュールが、アーキテクチャの変更なしに既存の視線推定手法を強化できるか。
- RQ5クロスデータセット評価において、本手法の性能が標準的な視線推定手法およびドメイン適応ベースラインと比較してどうなるか。
主な発見
- PureGaze は複数のベンチマークで最先端の性能を達成し、標準的な視線推定手法およびドメイン適応ベースラインを上回っている。
- 極端な照度条件下でも顕著な性能向上が確認され、低照度および高照度クラスタで顕著な改善が得られている。
- 可視化結果から、本手法が特徴空間から照度や個人差関連要因を効果的に除去しながら、視線に関連する情報を保持していることが確認された。
- プラグアンドプレイな SA-Module は、既存の視線推定モデルに対して直接的かつ一貫した向上効果を示しており、広範な互換性と有効性を示している。
- アブレーションスタディでは、二重目的の自己対抗学習スキームが、単一タスクベースラインよりもより一般化された特徴を生成していることが分かった。
- 微調整やターゲットドメインデータを必要とせず、多様なデータセット間で強い性能を維持していることから、ドメイン一般化能力が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。