[论文解读] It's Written All Over Your Face: Full-Face Appearance-Based Gaze Estimation
该论文提出了一种基于全脸外观的注视估计方法,采用具有空间自适应权重的卷积神经网络,动态强调信息丰富的面部区域。该方法在MPIIGaze和EYEDIAP数据集上分别实现了14.3%和27.7%的3D注视估计精度提升,尤其在极端头部姿态和光照变化条件下表现优异。
Eye gaze is an important non-verbal cue for human affect analysis. Recent gaze estimation work indicated that information from the full face region can benefit performance. Pushing this idea further, we propose an appearance-based method that, in contrast to a long-standing line of work in computer vision, only takes the full face image as input. Our method encodes the face image using a convolutional neural network with spatial weights applied on the feature maps to flexibly suppress or enhance information in different facial regions. Through extensive evaluation, we show that our full-face method significantly outperforms the state of the art for both 2D and 3D gaze estimation, achieving improvements of up to 14.3% on MPIIGaze and 27.7% on EYEDIAP for person-independent 3D gaze estimation. We further show that this improvement is consistent across different illumination conditions and gaze directions and particularly pronounced for the most challenging extreme head poses.
研究动机与目标
- 探究全脸外观方法是否能在注视估计中超越仅使用眼睛或多个区域的方法。
- 确定在不同光照、头部姿态和注视方向下,哪些面部区域对准确注视估计贡献最大。
- 开发一种深度学习架构,无需显式区域标注即可高效编码空间变化的面部区域重要性。
- 评估该方法在极端头部姿态和定向光照等具有挑战性的现实条件下的鲁棒性。
- 证明仅使用面部图像的输入流程在人员无关的3D注视估计中的可行性和优越性。
提出的方法
- 该方法采用标准CNN架构,以全脸图像作为输入,直接回归2D或3D注视方向。
- 引入空间权重机制,在特征图上学习位置相关的注意力权重,实现对不同面部区域信息的动态抑制或增强。
- 空间权重作为卷积层激活图上的可学习参数应用,使网络能够自适应地聚焦于相关面部区域。
- 通过消融实验分析区域重要性:在遮挡特定面部区域后评估模型性能,准确率下降程度反映其相对重要性。
- 利用三个面部关键点(左右眼角和嘴角)对人脸图像和重要性图进行对齐,以实现在不同受试者间的一致比较。
- 在MPIIGaze和EYEDIAP数据集上采用留一人为交叉验证方案进行模型训练与评估。
实验结果
研究问题
- RQ1全脸外观的注视估计方法是否能在3D注视估计中超越现有的仅使用眼睛或多个区域的方法?
- RQ2在不同光照、头部姿态和注视方向下,哪些面部区域对注视估计最具信息量?
- RQ3所提出的空间权重机制是否能提升对极端头部姿态和光照变化的鲁棒性?
- RQ4仅使用面部图像的输入方式与仅使用眼睛区域或多区域方法相比,性能如何?
- RQ5全脸方法在低分辨率图像或具有挑战性的野外条件下是否具有显著优势?
主要发现
- 所提出的全脸方法在MPIIGaze数据集上实现了4.8°的3D注视估计精度,相比之前SOTA方法提升14.3%。
- 在EYEDIAP数据集上,该方法实现了6.0°的3D注视估计精度,在人员无关评估中相比先前SOTA方法提升27.7%。
- 该方法在所有光照条件下均表现出一致的性能提升,尤其在强定向光照下提升最为显著。
- 区域重要性分析显示,随着注视方向趋于极端(尤其是侧向注视),非眼睛区域的重要性显著增加。
- 在极端头部姿态下,全脸输入相比仅眼睛基线方法表现出显著更优的性能,且非眼睛区域对估计精度的贡献更大。
- 空间权重机制使网络能够学习区域特定的注意力机制,模型在定向光照下更重视面部较亮一侧的区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。