[论文解读] Towards Self-Supervised Gaze Estimation
该论文提出 SwAT,一种新颖的自监督方法,通过扩展基于 SwAV 聚类的方法,在几何变换(例如旋转、翻转)下强制实现等变性,以提升眼动估计性能。利用大规模数据集(如 VGG-Face)中的未筛选人脸图像,SwAT 在跨数据集评估中相比监督基线模型性能提升高达 57%,在 ETH-XGaze、Gaze360 和 MPIIFaceGaze 的同数据集基准测试中性能提升达 25%。
Recent joint embedding-based self-supervised methods have surpassed standard supervised approaches on various image recognition tasks such as image classification. These self-supervised methods aim at maximizing agreement between features extracted from two differently transformed views of the same image, which results in learning an invariant representation with respect to appearance and geometric image transformations. However, the effectiveness of these approaches remains unclear in the context of gaze estimation, a structured regression task that requires equivariance under geometric transformations (e.g., rotations, horizontal flip). In this work, we propose SwAT, an equivariant version of the online clustering-based self-supervised approach SwAV, to learn more informative representations for gaze estimation. We demonstrate that SwAT, with ResNet-50 and supported with uncurated unlabeled face images, outperforms state-of-the-art gaze estimation methods and supervised baselines in various experiments. In particular, we achieve up to 57% and 25% improvements in cross-dataset and within-dataset evaluation tasks on existing benchmarks (ETH-XGaze, Gaze360, and MPIIFaceGaze).
研究动机与目标
- 探究自监督表示学习在眼动估计中的有效性,其中标注数据成本高且稀缺。
- 解决标准自监督方法中对不变性的假设与眼动估计等结构化回归任务所需的等变性之间的不匹配问题。
- 通过在旋转和水平翻转等变换下强制实现等变性,开发一种能够学习更具信息量、几何感知能力的表示方法。
- 证明在大规模、未筛选的人脸图像上进行预训练,可超越监督 ImageNet 预训练和当前最先进方法。
- 通过利用最小量的标注数据进行自监督学习,提升模型在不同领域间的泛化能力。
提出的方法
- 通过修改对比损失以保留特征在几何变换下的影响,提出 SwAT,即 SwAV 自监督学习框架的等变变体。
- 应用包括颜色抖动、随机裁剪以及几何变换(旋转、水平翻转)的数据增强技术,生成用于聚类的正样本视图。
- 通过确保变换输入的特征表示与原始输入特征经变换后的一致,利用可学习的变换模块来强制实现等变性。
- 采用在线聚类方法为视图分配目标,并以动量方式更新原型,与 SwAV 类似。
- 在小规模眼动标注数据集(如 ETH-XGaze、Gaze360)上微调预训练的 SwAT 编码器,用于下游眼动估计任务。
- 使用新型等变性损失 ℒ_equ 对模型保留变换影响的能力进行定量评估。
实验结果
研究问题
- RQ1与监督预训练相比,使用未筛选、大规模无标签人脸图像进行自监督学习,能否提升眼动估计性能?
- RQ2在几何变换(如旋转、翻转)下强制实现等变性,是否能带来比标准基于不变性的自监督方法更优的表示?
- RQ3SwAT 在跨数据集泛化方面表现如何,特别是在训练和测试数据来自不同分布的情况下?
- RQ4SwAT 是否能减少在真实部署中对大规模、精心筛选的眼动标注数据集的依赖?
- RQ5预训练数据集的选择(如 VGG-Face 与 ETH-XGaze)在多大程度上影响眼动估计模型的最终性能?
主要发现
- 在跨数据集评估中,SwAT 在 MPIIFaceGaze 基准上相比监督基线模型性能最高提升 57%。
- 在同数据集评估中,SwAT 在 ETH-XGaze 上相比监督基线模型性能最高提升 25%,在 MPIIFaceGaze∗ 上提升 19%。
- 在 VGG-Face 上预训练的 SwAT 表现优于监督基线模型以及在 ETH-XGaze 上预训练的 SwAT,证明了未筛选数据的有效性。
- 在 Gaze360 上,SwAT 的等变性损失(ℒ_equ)相比 SwAV 提升 27%,在 MPIIFaceGaze∗ 上提升 21%,证实了更强的几何等变性。
- 在 Gaze360 上,SwAT 将当前最先进性能提升 9%;在 MPIIFaceGaze∗ 上,相比 ETH-XGaze 方法在未归一化设置下提升 0.2°。
- 该方法在无约束场景下泛化良好,在多种测试领域和变换类型下均表现出一致的性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。