Skip to main content
QUICK REVIEW

[论文解读] Contrastive Representation Learning for Gaze Estimation

Swati Jindal, Roberto Manduchi|arXiv (Cornell University)|Oct 24, 2022
Gaze Tracking and Assistive Technology被引用 6
一句话总结

本文提出 GazeCLR,一种用于眼动估计的对比表示学习框架,利用多视角摄像头数据学习对外观变化具有不变性、对相机视角变化具有等变性的表示。通过在无标签多视角数据上使用保留眼动方向的增强方式开展对比学习预训练,GazeCLR 在跨域眼动估计中实现了最高 17.2% 的相对性能提升,并在少样本设置下表现优异。

ABSTRACT

Self-supervised learning (SSL) has become prevalent for learning representations in computer vision. Notably, SSL exploits contrastive learning to encourage visual representations to be invariant under various image transformations. The task of gaze estimation, on the other hand, demands not just invariance to various appearances but also equivariance to the geometric transformations. In this work, we propose a simple contrastive representation learning framework for gaze estimation, named Gaze Contrastive Learning (GazeCLR). GazeCLR exploits multi-view data to promote equivariance and relies on selected data augmentation techniques that do not alter gaze directions for invariance learning. Our experiments demonstrate the effectiveness of GazeCLR for several settings of the gaze estimation task. Particularly, our results show that GazeCLR improves the performance of cross-domain gaze estimation and yields as high as 17.2% relative improvement. Moreover, the GazeCLR framework is competitive with state-of-the-art representation learning methods for few-shot evaluation. The code and pre-trained models are available at https://github.com/jswati31/gazeclr.

研究动机与目标

  • 解决基于深度学习的眼动估计中标签数据有限的挑战。
  • 通过利用自监督学习,减少对昂贵且耗时的眼动标注的依赖。
  • 通过无监督预训练提升眼动估计在跨域场景下的泛化能力。
  • 同时学习对外观变化的不变性与对相机视角变化的等变性。
  • 开发一种可泛化的框架,适用于基于几何的视觉任务中的等变表示学习。

提出的方法

  • 采用两阶段框架:先在无监督数据上使用 GazeCLR 进行预训练,随后在少量标注数据上进行微调。
  • 从同一时间点拍摄的不同相机视角的多视角图像中构建正样本对,确保眼动方向一致。
  • 应用颜色抖动和随机裁剪等数据增强方法,这些方法不改变眼动方向,以促进不变性学习。
  • 通过利用已知的相对相机位姿,结合旋转矩阵,建立不同视角间眼动方向的关联,以实现等变性。
  • 训练对比学习目标,使相同主体、相同眼动方向的正样本对在嵌入空间中更接近,而负样本对则被推开。
  • 使用 EVE 多视角眼动数据集进行预训练,在此阶段丢弃眼动标签,但利用相机位姿信息实现等变性学习。

实验结果

研究问题

  • RQ1通过平衡不变性与等变性,对比表示学习能否被有效应用于眼动估计?
  • RQ2在无标签多视角数据上进行预训练,如何提升跨域眼动估计的泛化能力?
  • RQ3GazeCLR 在少样本眼动估计中,能在多大程度上减少微调所需的标注样本数量?
  • RQ4通过多视角几何学习等变性,是否能相比仅采用不变性方法提升表示质量?
  • RQ5所提出的框架是否能超越源域,在如 MPIIGaze 和 Columbia 等多样化数据集上表现良好?

主要发现

  • 与基线方法相比,GazeCLR 在跨域眼动估计性能上实现了最高 17.2% 的相对提升。
  • 该框架在少样本泛化方面表现强劲,在微调时仅使用有限标注数据,其性能可与当前最先进表示学习方法相媲美。
  • t-SNE 可视化结果表明,GazeCLR 学习到了解耦的表示:同一主体在不同视角下的嵌入聚类在一起,而不同主体的表示则被有效分离。
  • 该模型学习到的表示对外观变化(如光照、身份)具有不变性,并通过旋转感知的对比学习实现了对视角变化的等变性。
  • 利用已知相机位姿的多视角数据,可在无需眼动标注的情况下实现有效的等变性学习。
  • GazeCLR 的预训练编码器在目标域(如 MPIIGaze 和 Columbia)上具有良好的泛化能力,即使仅使用极少微调数据也能表现良好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。