Skip to main content
QUICK REVIEW

[论文解读] MagicEyes: A Large Scale Eye Gaze Estimation Dataset for Mixed Reality

Zhengyang Wu, Srivignesh Rajendran|arXiv (Cornell University)|Mar 18, 2020
Gaze Tracking and Assistive Technology参考文献 37被引用 4
一句话总结

本文介绍了 MagicEyes,一个使用真实混合现实设备收集的大规模眼动估计数据集,包含 587 名受试者、80,000 张人工标注的人眼图像,以及超过 800,000 个眼动目标标签。该研究提出 EyeNet,一种多任务深度学习模型,可在单次前向传播中联合估计角膜中心、反光点、瞳孔和眼部分割,相较于传统基于启发式规则的流水线,在非轴向眼图像上表现出更高的鲁棒性和效率。

ABSTRACT

With the emergence of Virtual and Mixed Reality (XR) devices, eye tracking has received significant attention in the computer vision community. Eye gaze estimation is a crucial component in XR -- enabling energy efficient rendering, multi-focal displays, and effective interaction with content. In head-mounted XR devices, the eyes are imaged off-axis to avoid blocking the field of view. This leads to increased challenges in inferring eye related quantities and simultaneously provides an opportunity to develop accurate and robust learning based approaches. To this end, we present MagicEyes, the first large scale eye dataset collected using real MR devices with comprehensive ground truth labeling. MagicEyes includes $587$ subjects with $80,000$ images of human-labeled ground truth and over $800,000$ images with gaze target labels. We evaluate several state-of-the-art methods on MagicEyes and also propose a new multi-task EyeNet model designed for detecting the cornea, glints and pupil along with eye segmentation in a single forward pass.

研究动机与目标

  • 解决混合现实(MR)设备中非轴向眼动估计缺乏大规模真实世界数据集的问题。
  • 在包含丰富标注的全面真实设备采集数据集上,对最先进方法进行基准测试。
  • 开发一种统一的深度学习框架,联合估计关键眼特征(瞳孔、反光点、角膜、分割),以提升鲁棒性和效率。
  • 实现端到端基于学习的眼动估计,使其在真实环境中优于混合几何与启发式方法。

提出的方法

  • MagicEyes 数据集使用真实 MR 设备采集,从 587 名受试者获取了 640×480 分辨率的红外眼图像,覆盖多样的光照和人口统计条件。
  • 数据集包含 80,000 张图像,其眼部分割(面部、巩膜、虹膜、瞳孔)具有人工验证的真值,另有超过 800,000 张图像带有眼动目标标签。
  • EyeNet 是一种多任务深度神经网络,采用共享的 ResNet-50 + FPN 编码器和四个针对不同任务的解码器,分别用于眼部分割、瞳孔与反光点定位,以及角膜中心估计。
  • 该模型通过单次前向传播预测多个输出,利用共享特征提升泛化能力并降低计算成本。
  • 网络结合了监督学习与几何约束,利用可微分的 3D 眼模型,从 2D 预测结果优化眼动估计。
  • 评估包括消融研究,以及与 SOTA 方法如 RlTNet 和 NVGaze 在分割、瞳孔定位和眼动估计任务上的对比。

实验结果

研究问题

  • RQ1最先进的眼动估计方法在使用真实混合现实设备采集的大规模真实世界数据集上的表现如何?
  • RQ2多任务深度学习模型是否能比独立或基于启发式规则的流水线更鲁棒地联合估计眼特征(瞳孔、反光点、角膜中心、分割)?
  • RQ3在非轴向、真实世界的眼成像条件下,端到端学习结合几何先验在多大程度上提升了眼动估计的准确性?
  • RQ4与混合几何方法相比,当前端到端深度学习方法在眼动估计方面存在哪些局限性?

主要发现

  • MagicEyes 是目前公开可用的、使用真实 MR 设备收集的最大规模眼动估计数据集,包含 587 名受试者和超过 800,000 个眼动目标标签。
  • 全卷积网络在眼部分割和瞳孔定位任务上表现强劲,表明几何方法在真实世界场景中具有潜力。
  • 直接的端到端深度学习方法(如 NVGaze)尽管在理想条件下表现优异,但表现出较高的方差,不适合真实世界部署。
  • 所提出的 EyeNet 模型通过联合估计角膜中心、反光点、瞳孔和分割,优于基线方法,减少了对手工设计启发式规则的依赖。
  • 将几何约束整合到学习过程中,显著提升了眼动估计的鲁棒性和准确性,尤其在具有挑战性的非轴向观察条件下。
  • 本研究证明,通过共享表示的多任务学习可在单次推理中更高效、更准确地估计多种眼相关量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。