[论文解读] LatentGaze: Cross-Domain Gaze Estimation through Gaze-Aware Analytic Latent Code Manipulation
LatentGaze 提出了一种新颖的跨域眼动估计方法,通过生成对抗网络(GAN)反演技术对解耦的潜在代码进行眼动感知操控,以分离出与眼动相关的关键特征。通过使用基于 GAN 的编码器-生成器将目标域图像投影到源域,并应用眼动失真损失,该模型在跨数据集眼动估计任务中实现了最先进(SOTA)的准确率。
Although recent gaze estimation methods lay great emphasis on attentively extracting gaze-relevant features from facial or eye images, how to define features that include gaze-relevant components has been ambiguous. This obscurity makes the model learn not only gaze-relevant features but also irrelevant ones. In particular, it is fatal for the cross-dataset performance. To overcome this challenging issue, we propose a gaze-aware analytic manipulation method, based on a data-driven approach with generative adversarial network inversion's disentanglement characteristics, to selectively utilize gaze-relevant features in a latent code. Furthermore, by utilizing GAN-based encoder-generator process, we shift the input image from the target domain to the source domain image, which a gaze estimator is sufficiently aware. In addition, we propose gaze distortion loss in the encoder that prevents the distortion of gaze information. The experimental results demonstrate that our method achieves state-of-the-art gaze estimation accuracy in a cross-domain gaze estimation tasks. This code is available at https://github.com/leeisack/LatentGaze/.
研究动机与目标
- 解决由于眼动相关特征定义模糊而导致的跨域眼动估计中无关特征学习的问题。
- 通过基于 GAN 的图像翻译将目标域图像对齐到源域,缓解域偏移问题。
- 在编码过程中引入眼动失真损失,确保眼动信息在域适应过程中得以保留。
- 通过在潜在空间中解耦眼动相关组件,实现跨多样化数据集的鲁棒眼动估计。
- 通过分析性操控潜在代码,聚焦于判别性眼动相关特征,提升模型泛化能力。
提出的方法
- 利用基于 GAN 的编码器-生成器框架,将目标域眼图像反演至源域分布,以减少域偏移。
- 应用分析性潜在代码操控,选择性地提取并增强潜在空间中的眼动相关组件。
- 在编码过程中引入眼动失真损失,以在图像翻译过程中保留眼动相关信息。
- 利用 GAN 反演的解耦特性,从身份和光照变化中分离出眼动特定特征。
- 在翻译后的源域图像上训练眼动估计器,这些图像现已与训练分布在语义上对齐。
- 通过组合重建损失、对抗损失和眼动特定损失,端到端优化整个流程。
实验结果
研究问题
- RQ1对解耦潜在代码进行眼动感知操控,能否提升跨域眼动估计性能?
- RQ2基于 GAN 的图像翻译在减少眼动估计任务中的域偏移方面有多有效?
- RQ3眼动失真损失在多大程度上能防止域适应过程中眼动相关特征的退化?
- RQ4潜在代码的分析性操控能否在跨数据集眼动估计中超越传统特征提取方法?
- RQ5所提出方法在具有不同光照、姿态和身份条件的多样化数据集上是否具备良好的泛化能力?
主要发现
- 所提方法在多个跨域眼动估计基准上实现了最先进性能。
- 眼动失真损失显著减少了图像翻译过程中眼动相关特征的退化。
- 潜在代码操控实现了对眼动相关组件的选择性聚焦,降低了无关属性的干扰。
- 基于 GAN 的图像翻译有效将目标域图像对齐至源域分布,提升了泛化能力。
- 该模型在多样化数据集上表现出鲁棒性能,包括光照和姿态条件各异的未见域。
- 消融实验验证了眼动失真损失与眼动感知潜在操控组件的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。