Skip to main content
QUICK REVIEW

[论文解读] A Coarse-to-Fine Adaptive Network for Appearance-Based Gaze Estimation

Yihua Cheng, Shiyao Huang|arXiv (Cornell University)|Jan 1, 2020
Gaze Tracking and Assistive Technology参考文献 30被引用 13
一句话总结

该论文提出CA-Net,一种基于外观的3D视线估计的粗到细自适应网络,利用人脸图像进行粗略视线预测,并利用眼图进行残差优化。通过引入双向语言模型以关联基础视线与残差,并采用注意力机制自适应地加权左右眼特征,CA-Net在MPIIGaze(4.14°)和EyeDiap基准上实现了最先进性能。

ABSTRACT

Human gaze is essential for various appealing applications. Aiming at more accurate gaze estimation, a series of recent works propose to utilize face and eye images simultaneously. Nevertheless, face and eye images only serve as independent or parallel feature sources in those works, the intrinsic correlation between their features is overlooked. In this paper we make the following contributions: 1) We propose a coarse-to-fine strategy which estimates a basic gaze direction from face image and refines it with corresponding residual predicted from eye images. 2) Guided by the proposed strategy, we design a framework which introduces a bi-gram model to bridge gaze residual and basic gaze direction, and an attention component to adaptively acquire suitable fine-grained feature. 3) Integrating the above innovations, we construct a coarse-to-fine adaptive network named CA-Net and achieve state-of-the-art performances on MPIIGaze and EyeDiap.

研究动机与目标

  • 为解决现有基于外观的视线估计方法将人脸与眼图视为独立特征源的问题,忽略了其内在关联性。
  • 通过利用粗粒度人脸特征与细粒度眼图特征的互补性,提升视线估计精度。
  • 设计一种框架,以粗到细的方式自适应融合来自人脸与眼图的多级特征。
  • 通过在标准基准上的消融实验与对比研究,验证所提粗到细策略的有效性。

提出的方法

  • 提出一种粗到细策略:首先从人脸图像特征中估计基础视线方向,然后利用眼图特征预测的视线残差进行优化。
  • 引入双向语言模型,显式建模基础视线方向与预测视线残差之间的依赖关系,提升残差估计精度。
  • 采用注意力模块,基于人脸与眼图特征自适应地为左右眼特征分配权重,实现对相关细粒度信息的动态选择。
  • 构建CA-Net为端到端深度学习框架,整合粗到细策略、双向语言模型与自适应注意力机制,用于3D视线估计。
  • 使用向量加法将基础视线方向与视线残差相结合,生成最终的视线预测结果。
  • 利用卷积神经网络进行特征提取:一个用于人脸图像(粗粒度特征),另一个用于眼图(细粒度特征)。

实验结果

研究问题

  • RQ1与将人脸与眼图作为并行输入相比,通过分层方式利用人脸与眼图的粗到细策略是否能显著提升视线估计精度?
  • RQ2双向语言模型在建模基础视线方向与视线残差之间关系方面是否有效,从而提升优化效果?
  • RQ3一种能自适应加权左右眼特征的注意力机制是否能提升视线估计的鲁棒性与精度?
  • RQ4与反向的细到粗方法相比,所提出的粗到细策略是否更具有效性?
  • RQ5在MPIIGaze与EyeDiap等标准基准上,所提出的CA-Net与现有最先进方法相比表现如何?

主要发现

  • CA-Net在MPIIGaze基准上实现4.14°的平均误差,优于以往最先进方法。
  • 粗到细策略显著优于细到粗的替代方案,平均误差降低0.49°。
  • 与单向语言模型基线相比,双向语言模型使性能提升0.29°,证明了建模视线方向-残差依赖关系的价值。
  • 所提出的注意力组件性能优于仅使用人脸或仅使用眼图的注意力基线,证实其在特征加权中的有效性。
  • 消融实验表明,双向语言模型与自适应注意力的结合带来最佳性能,验证了各组件之间的协同效应。
  • 可视化结果表明,CA-Net在各种头部姿态与视线方向下均具有良好泛化能力,包括视线偏离人脸中心的情况。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。