Skip to main content
QUICK REVIEW

[論文レビュー] Contrastive Representation Learning for Gaze Estimation

Swati Jindal, Roberto Manduchi|arXiv (Cornell University)|Oct 24, 2022
Gaze Tracking and Assistive Technology被引用数 6
ひとこと要約

本稿では、外見の変化に対して不変で、カメラの視点変更に対して等長性を示す表現を学習するための、多視点カメラデータを活用する対照的表現学習フレームワークGazeCLRを提案する。視線方向を保持する増幅を用いた対照的学習により、未ラベルの多視点データで事前学習することで、クロスドメイン視線推定において最大17.2%の相対的改善を達成し、少サンプル設定でも競争力のある性能を示す。

ABSTRACT

Self-supervised learning (SSL) has become prevalent for learning representations in computer vision. Notably, SSL exploits contrastive learning to encourage visual representations to be invariant under various image transformations. The task of gaze estimation, on the other hand, demands not just invariance to various appearances but also equivariance to the geometric transformations. In this work, we propose a simple contrastive representation learning framework for gaze estimation, named Gaze Contrastive Learning (GazeCLR). GazeCLR exploits multi-view data to promote equivariance and relies on selected data augmentation techniques that do not alter gaze directions for invariance learning. Our experiments demonstrate the effectiveness of GazeCLR for several settings of the gaze estimation task. Particularly, our results show that GazeCLR improves the performance of cross-domain gaze estimation and yields as high as 17.2% relative improvement. Moreover, the GazeCLR framework is competitive with state-of-the-art representation learning methods for few-shot evaluation. The code and pre-trained models are available at https://github.com/jswati31/gazeclr.

研究の動機と目的

  • 深層学習ベースの視線推定におけるラベル付き視線データの不足という課題に対処すること。
  • 自己教師あり学習を活用することで、高コストで時間がかかる視線アノテーションに依存するのを減らすこと。
  • 教師なし事前学習を用いて、視線推定におけるクロスドメイン一般化性能を向上させること。
  • 外見の変化に対して不変で、カメラの視点変更に対して等長性を示す表現を同時に学習すること。
  • 幾何学的ビジョンタスクに応用可能な、一般化可能な等長表現学習フレームワークの開発

提案手法

  • 2段階フレームワークを採用:GazeCLRによる教師なし事前学習の後、少量のラベル付きデータでの微調整。
  • 同じ被験者で同じ視線方向を持つ、同時に撮影された多視点画像からポジティブペアを構築する。
  • 視線方向を変更しないように、色のずれやランダムクロップなどのデータ増幅を適用し、不変性を促進する。
  • 既知の相対的なカメラポーズを活用して回転行列を用いて、視点間での視線方向を関連づけ、等長性を強制する。
  • 同じ被験者・同じ視線のペア(ポジティブ)を埋め込み空間で近づけ、ネガティブペアを遠ざける対照的学習目的関数を訓練する。
  • 事前学習段階では視線ラベルを破棄するが、カメラポーズ情報を利用して等長性学習を実施するため、EVE多視点視線データセットを活用する。

実験結果

リサーチクエスチョン

  • RQ1不変性と等長性のバランスをとることで、対照的表現学習を視線推定に効果的に適応できるか?
  • RQ2未ラベルの多視点データで事前学習することで、クロスドメイン視線推定における一般化性能がどのように向上するか?
  • RQ3GazeCLRは、少サンプル視線推定における微調整に必要なラベル付きサンプル数をどの程度削減できるか?
  • RQ4多視点幾何学を用いた等長性学習は、標準的な不変性のみを学習するアプローチと比較して、表現品質を向上させるか?
  • RQ5提案フレームワークは、元のドメインを超えて一般化可能であり、MPIIGaze や Columbia などの多様なデータセットでも良好に動作するか?

主な発見

  • GazeCLRは、ベースライン手法と比較して、クロスドメイン視線推定性能で最大17.2%の相対的改善を達成した。
  • 本フレームワークは、少量のラベル付きデータでの微調整においても、最先端の表現学習手法と競争力ある性能を示した。
  • t-SNE可視化により、GazeCLRは分離可能な表現を学習していることが確認された:同じ被験者の異なる視点からの埋め込みはクラスタを形成し、異なる被験者のものは分離されている。
  • モデルは、照明や被験者本人の外見の変化に対して不変で、回転に注意を払った対照的学習により、視点変更に対して等長性を持つ表現を学習した。
  • 既知のカメラポーズを有する多視点データを用いることで、事前学習段階で視線アノテーションが不要な状態で効果的な等長性学習が可能になった。
  • GazeCLRで事前学習されたエンコーダーは、MPIIGaze や Columbia などのターゲットドメインに良好に一般化され、微調整に必要なデータが最小限でも高い性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。