[论文解读] MPIIGaze: Real-World Dataset and Deep Appearance-Based Gaze Estimation
本文介绍了MPIIGaze,一个大规模真实世界数据集,包含15名用户在日常笔记本电脑使用过程中收集的213,659张完整人脸图像,涵盖眼睛外观、光照和头部姿态的高多样性变化。该研究提出GazeNet,一种基于深度外观的注视估计方法,采用16层VGG卷积神经网络,在跨数据集评估中将平均误差降低了22%(降至10.8°),优于先前最先进方法。
Learning-based methods are believed to work well for unconstrained gaze estimation, i.e. gaze estimation from a monocular RGB camera without assumptions regarding user, environment, or camera. However, current gaze datasets were collected under laboratory conditions and methods were not evaluated across multiple datasets. Our work makes three contributions towards addressing these limitations. First, we present the MPIIGaze that contains 213,659 full face images and corresponding ground-truth gaze positions collected from 15 users during everyday laptop use over several months. An experience sampling approach ensured continuous gaze and head poses and realistic variation in eye appearance and illumination. To facilitate cross-dataset evaluations, 37,667 images were manually annotated with eye corners, mouth corners, and pupil centres. Second, we present an extensive evaluation of state-of-the-art gaze estimation methods on three current datasets, including MPIIGaze. We study key challenges including target gaze range, illumination conditions, and facial appearance variation. We show that image resolution and the use of both eyes affect gaze estimation performance while head pose and pupil centre information are less informative. Finally, we propose GazeNet, the first deep appearance-based gaze estimation method. GazeNet improves the state of the art by 22% percent (from a mean error of 13.9 degrees to 10.8 degrees) for the most challenging cross-dataset evaluation.
研究动机与目标
- 通过在日常条件下收集大规模、多样化的数据集,解决真实世界非受限注视估计数据集缺乏的问题。
- 通过在部分图像上手动标注面部关键点和瞳孔中心,支持跨数据集评估及相关任务。
- 研究关键挑战——注视范围、光照条件和个人外观——对注视估计性能的影响。
- 开发并评估一种能够泛化于真实世界变化的深度外观基注视估计方法。
- 通过在多个数据集上评估最先进方法,建立非受限注视估计的基准。
提出的方法
- MPIIGaze数据集采用体验抽样方法收集,用户在随机时间间隔被提示注视屏幕上的不同位置,以模拟日常笔记本使用场景。
- 数据集包含213,659张完整人脸RGB图像及其对应的3D注视目标,真实捕捉光照、眼睛外观和头部姿态的多样性变化。
- 从37,667张图像中手动标注了六个面部关键点(眼角和嘴角)及瞳孔中心,以支持跨数据集评估及相关任务。
- GazeNet是一种16层VGG结构的卷积神经网络,仅使用外观特征,不显式输入头部姿态或关键点信息,通过回归从眼部区域图像预测3D注视方向。
- 该模型在多个数据集(包括MPIIGaze、EYEDIAP和UT Multiview)上进行训练与评估,并对输入模态和数据分布进行了广泛的消融研究。
- 性能通过跨数据集和同数据集设置下的平均角度误差(MAE)进行评估,并与最先进方法(包括基于形状的方法和基于合成的方法)进行比较。
实验结果
研究问题
- RQ1在真实世界数据集之间进行评估时,注视估计性能相较于同数据集评估会如何退化?
- RQ2注视范围、光照条件和个人外观的变化在非受限注视估计性能差距中分别占多大程度?
- RQ3在真实世界非受限环境下,基于深度外观的方法能否优于现有的基于模型和混合方法?
- RQ4在真实世界数据中,头部姿态和瞳孔中心信息作为辅助输入在深度学习注视估计中的有效性如何?
- RQ5使用合成数据进行预训练对泛化到真实世界测试数据的影响是什么?
主要发现
- 所提出的GazeNet方法在最具挑战性的跨数据集评估中,将平均角度误差从13.9°降低至10.8°,相比先前最先进方法提升了22%。
- 光照条件被发现导致了跨数据集评估中35%的性能差距,凸显其在真实世界注视估计中的关键作用。
- 个人外观差异导致了40%的性能差距,强调了多样化训练数据对泛化能力的重要性。
- 注视范围限制导致了25%的性能差距,表明更广泛的训练覆盖范围可提升模型鲁棒性。
- 将头部姿态或瞳孔中心信息作为输入仅带来微小的性能增益,表明在非受限环境下其辅助作用有限。
- 同数据集与跨数据集评估之间的性能差距显著,揭示了先前评估中存在严重的领域偏移和数据集偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。