Skip to main content
QUICK REVIEW

[论文解读] Jitter Does Matter: Adapting Gaze Estimation to New Domains

Ruicong Liu, Yiwei Bao|arXiv (Cornell University)|Oct 5, 2022
Neonatal and fetal brain pathology被引用 4
一句话总结

本文提出了一种新颖的眼动估计域适应框架,通过识别高频分量(HFC)作为导致眼动抖动(对相似图像产生严重预测偏差)的关键原因,有效缓解了该问题。通过引入对抗性HFC扰动,并利用对比学习强制原始输入与扰动输入之间的特征一致性,该方法在仅使用少量目标域数据的情况下,显著降低了眼动抖动并提升了跨域眼动估计的准确性。

ABSTRACT

Deep neural networks have demonstrated superior performance on appearance-based gaze estimation tasks. However, due to variations in person, illuminations, and background, performance degrades dramatically when applying the model to a new domain. In this paper, we discover an interesting gaze jitter phenomenon in cross-domain gaze estimation, i.e., the gaze predictions of two similar images can be severely deviated in target domain. This is closely related to cross-domain gaze estimation tasks, but surprisingly, it has not been noticed yet previously. Therefore, we innovatively propose to utilize the gaze jitter to analyze and optimize the gaze domain adaptation task. We find that the high-frequency component (HFC) is an important factor that leads to jitter. Based on this discovery, we add high-frequency components to input images using the adversarial attack and employ contrastive learning to encourage the model to obtain similar representations between original and perturbed data, which reduces the impacts of HFC. We evaluate the proposed method on four cross-domain gaze estimation tasks, and experimental results demonstrate that it significantly reduces the gaze jitter and improves the gaze estimation performance in target domains.

研究动机与目标

  • 探究在跨域眼动估计中,为何相似图像会产生显著偏离的预测结果(即眼动抖动)的根本原因。
  • 识别高频分量(HFC)为导致目标域中眼动抖动的主要因素。
  • 开发一种域适应框架,以抑制HFC的影响,从而提升泛化能力并减少预测不一致性。
  • 在仅使用少量目标数据的多个跨域眼动估计基准上验证该方法的有效性。

提出的方法

  • 该方法通过在输入图像上引入对抗性高频分量(HFC)扰动,以模拟并暴露导致眼动抖动的噪声。
  • 应用对比学习,对齐原始图像与HFC扰动后图像的特征表示,从而增强对高频变化的鲁棒性。
  • 采用端到端训练方式,利用对比损失最小化正样本对(原始图像与扰动图像)之间的距离,同时最大化负样本对之间的距离。
  • 在少量未标注的目标域样本上进行微调,实现无监督域适应。
  • 主干网络采用ResNet18,适应过程使用对比学习目标,以在HFC扰动下稳定预测结果。
  • 在标准无监督域适应(UDA)设置下进行评估,消融实验验证了HFC与对比学习在降低眼动抖动中的关键作用。

实验结果

研究问题

  • RQ1在跨域眼动估计中,为何对非常相似的图像会产生严重的眼动预测偏差(即眼动抖动)?
  • RQ2为何眼动抖动主要出现在目标域,尽管在源域中预测结果保持一致?
  • RQ3在跨域设置中,高频分量(HFC)在多大程度上可被认定为眼动抖动的根本原因?
  • RQ4通过对抗性HFC注入结合对比学习,能否有效降低眼动抖动并提升域泛化能力?
  • RQ5与当前最先进的无监督域适应技术相比,该方法在眼动估计任务中的表现如何?

主要发现

  • 在E→M任务中,该方法将平均绝对误差(MAE)从8.56°降低至5.35°,减少了2.96°,显著优于基线模型。
  • 在G→D任务中,该方法实现了4.41°的MAE,相比基线(7.68°)提升了3.27°,展现出强大的泛化能力。
  • 在所有测试的跨域任务中,该方法使眼动抖动降低了30–50%,其衡量标准为相似图像对上的预测一致性。
  • 适应后,源域上的性能仅轻微下降,平均MAE增加不足0.5°,表明负迁移效应极小。
  • 即使仅使用100个目标样本,该方法在全部四个基准任务上仍优于当前最先进的UDA方法(如DAGEN、GazeAdv和PureGaze)。
  • 消融实验确认,HFC是导致眼动抖动的主要因素,且对比学习能有效缓解其对眼动预测的影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。