[論文レビュー] Jitter Does Matter: Adapting Gaze Estimation to New Domains
本論文は、類似画像に対して著しく予測がずれる「がけっぷち(gaze jitter)」を軽減するため、高周波成分(HFC)をその主な原因と特定することで、新たな眼球位置推定の適応フレームワークを提案する。敵対的HFCノイズを入力画像に適用し、元の入力と摂動を加えた入力の間で特徴表現の一貫性を保つための対照的学習を適用することで、がけっぷちを顕著に低減し、限られたターゲットデータでも、クロスドメインの眼球位置推定精度を向上させる。
Deep neural networks have demonstrated superior performance on appearance-based gaze estimation tasks. However, due to variations in person, illuminations, and background, performance degrades dramatically when applying the model to a new domain. In this paper, we discover an interesting gaze jitter phenomenon in cross-domain gaze estimation, i.e., the gaze predictions of two similar images can be severely deviated in target domain. This is closely related to cross-domain gaze estimation tasks, but surprisingly, it has not been noticed yet previously. Therefore, we innovatively propose to utilize the gaze jitter to analyze and optimize the gaze domain adaptation task. We find that the high-frequency component (HFC) is an important factor that leads to jitter. Based on this discovery, we add high-frequency components to input images using the adversarial attack and employ contrastive learning to encourage the model to obtain similar representations between original and perturbed data, which reduces the impacts of HFC. We evaluate the proposed method on four cross-domain gaze estimation tasks, and experimental results demonstrate that it significantly reduces the gaze jitter and improves the gaze estimation performance in target domains.
研究の動機と目的
- クロスドメイン眼球位置推定において、類似画像が著しく異なる眼球位置予測を示す原因を特定すること。
- ターゲットドメインでがけっぷちを引き起こす主な要因として、高周波成分(HFC)を同定すること。
- HFCの影響を抑えることで一般化性能を向上させ、予測の一貫性を向上させるドメイン適応フレームワークを開発すること。
- 限られたターゲットデータを用いて、複数のクロスドメイン眼球位置推定ベンチマークで本手法の有効性を検証すること。
提案手法
- 入力画像に敵対的高周波成分(HFC)摂動を適用することで、がけっぷちを引き起こすノイズを模擬・露呈する。
- 元の画像とHFC摂動を加えた画像の特徴表現を一致させるために、対照的学習を適用し、高周波変動に対して頑健な特徴を学習する。
- 正例ペア(元の画像と摂動付き画像)間の距離を最小化し、負例ペア間の距離を最大化するように、対照的損失を用いてエンドツーエンドで学習する。
- 少量のラベルなしターゲットドメインサンプルを用いて微調整することで、教師なしドメイン適応を実現する。
- バックボーンネットワークはResNet18であり、適応プロセスではHFC摂動に対する予測安定化を目的とした対照的学習目的関数を用いる。
- 標準的なUDA設定下で手法を評価し、アブレーションスタディによりHFCおよび対照的学習ががけっぷち低減に果たす役割を確認した。
実験結果
リサーチクエスチョン
- RQ1クロスドメイン眼球位置推定において、非常に類似した画像に対して著しく異なる眼球位置予測が生じる原因は何か?
- RQ2ソースドメインでは一貫した予測が得られるにもかかわらず、なぜがけっぷちは主にターゲットドメインで発生するのか?
- RQ3高周波成分(HFC)がクロスドメイン設定においてがけっぷちの主な原因であると特定できる程度はどの程度か?
- RQ4敵対的HFC注入と対照的学習を組み合わせることで、がけっぷちを効果的に低減し、ドメイン一般化性能を向上させられるか?
- RQ5本手法は、眼球位置推定分野における最先端の教師なしドメイン適応手法と比較して、どの程度優れているか?
主な発見
- E→Mタスクにおいて、平均絶対誤差(MAE)を8.56°から5.35°にまで2.96°低減し、ベースラインを著しく上回った。
- G→DタスクではMAEが4.41°にまで低下し、ベースライン(7.68°)と比較して3.27°の改善を達成した。これは強力な一般化性能を示している。
- 全テスト済みクロスドメインタスクにおいて、がけっぷちは30–50%低減された。類似画像ペアの予測一貫性を測定した結果、その効果が裏付けられた。
- 適応後、ソースドメインの性能はわずかに低下するのみで、平均してMAEが0.5°未満にしか上昇しなかった。これは負の転送効果が最小限であることを示している。
- 100個のターゲットサンプルのみを用いても、DAGEN、GazeAdv、PureGazeといった最先端のUDA手法を、全4ベンチマークタスクで上回った。
- アブレーションスタディにより、HFCががけっぷちの主な要因であることが確認され、対照的学習がその影響を効果的に緩和することが分かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。