[論文レビュー] Towards Self-Supervised Gaze Estimation
本稿では、回転や反転などの幾何変換における等長性を強制することで、視線推定に向けた新しい自己教師あり手法SwATを提案する。VGG-Faceなどの大規模データセットから得た未加工の顔画像を用いて、クロスデータセット評価では自己教師ありベースラインを最大57%、同一データセットベンチマークではETH-XGaze、Gaze360、MPIIFaceGazeで最大25%の性能向上を達成した。
Recent joint embedding-based self-supervised methods have surpassed standard supervised approaches on various image recognition tasks such as image classification. These self-supervised methods aim at maximizing agreement between features extracted from two differently transformed views of the same image, which results in learning an invariant representation with respect to appearance and geometric image transformations. However, the effectiveness of these approaches remains unclear in the context of gaze estimation, a structured regression task that requires equivariance under geometric transformations (e.g., rotations, horizontal flip). In this work, we propose SwAT, an equivariant version of the online clustering-based self-supervised approach SwAV, to learn more informative representations for gaze estimation. We demonstrate that SwAT, with ResNet-50 and supported with uncurated unlabeled face images, outperforms state-of-the-art gaze estimation methods and supervised baselines in various experiments. In particular, we achieve up to 57% and 25% improvements in cross-dataset and within-dataset evaluation tasks on existing benchmarks (ETH-XGaze, Gaze360, and MPIIFaceGaze).
研究の動機と目的
- ラベル付きデータが高価で不足しがちな視線推定において、自己教師あり表現学習の有効性を調査すること。
- 標準的な自己教師あり手法における不変性と、視線推定のような構造的回帰タスクに必要な等長性との不一致を解決すること。
- 回転や水平反転などの変換における等長性を強制することで、より情報量が多く幾何学的感度の高い表現を学習する手法を開発すること。
- 大規模で未加工の顔画像を事前学習することにより、自己教師ありImageNet事前学習や最先端手法を上回ることを示すこと。
- 最小限のラベル付きデータを用いた自己教師あり学習により、ドメイン間一般化を向上させること。
提案手法
- 変換の効果を特徴量に保持するように対照的損失を変更することで、SwAV自己教師あり学習フレームワークの等長変種であるSwATを提案する。
- 色のジャイタ、ランダムクロッピング、および幾何変換(回転、水平反転)を適用して、クラスタリング用のポジティブビューを生成する。
- 変換された入力の特徴量が元の入力の特徴量を変換したものと一致するように、等長性を保証する。これには学習可能な変換モジュールを用いる。
- オンラインクラスタリングを用いてビューにターゲットを割り当て、モーメンタムベースの方法でプロトタイプを更新する。これはSwAVと同様の手法である。
- 下流の視線推定タスク用に、小規模な視線アノテーション付きデータセット(例:ETH-XGaze、Gaze360)で事前学習済みのSwATエンコーダーを微調整する。
- 変換効果の保持具合を定量的に測定するため、新しい等長性損失ℒ_equを用いて手法を評価する。
実験結果
リサーチクエスチョン
- RQ1未加工で大規模なラベルなし顔画像を用いた自己教師あり学習は、自己教師あり事前学習に比べて視線推定性能を向上させるか?
- RQ2回転や反転などの幾何変換における等長性を強制することで、標準的な不変性ベースの自己教師あり手法に比べて、視線推定に適した表現が得られるか?
- RQ3SwATは、トレーニングデータとテストデータが異なる分布に属する場合のクロスデータセット一般化において、どのように性能を発揮するか?
- RQ4SwATは、実世界の展開において、大規模で丁寧に整備された視線アノテーション付きデータセットの必要性を低減できるか?
- RQ5事前学習データセットの選択(例:VGG-Face対ETH-XGaze)が、視線推定モデルの最終的性能にどの程度影響を与えるか?
主な発見
- クロスデータセット評価では、SwATがETH-XGaze、Gaze360、MPIIFaceGazeで自己教師ありベースラインを最大57%向上させた。特にMPIIFaceGazeベンチマークで顕著な向上を示した。
- 同一データセット評価では、SwATはETH-XGazeで最大25%、MPIIFaceGaze∗で最大19%の自己教師ありベースライン向上を達成した。
- VGG-Faceで事前学習したSwATは、自己教師ありベースラインおよびETH-XGazeで事前学習したSwATを上回り、未加工データの有効性を示した。
- Gaze360ではSwAVに比べて等長性損失(ℒ_equ)が27%相対的に改善され、MPIIFaceGaze∗では21%改善された。これは、より強い幾何的等長性を示している。
- Gaze360ではSOTAを9%向上させ、MPIIFaceGaze∗ではETH-XGaze手法を0.2°の未正規化設定で0.2°向上させた。
- 制約のない状況にもよく一般化し、多様なテストドメインおよび変換タイプにおいて一貫した向上を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。