[论文解读] EyeNet: A Multi-Task Network for Off-Axis Eye Gaze Estimation and User Understanding
EyeNet 是一种多任务深度神经网络,可联合估计虚拟现实/混合现实(VR/MR)系统中非轴向眼动图像的视线方向、图像分割、眨眼检测、情绪表情以及反光点位置。通过在不同任务间共享特征,并结合人工标注与基于模型的监督,其推理时间仅为12ms,实现了最先进精度,无需依赖人工设计的几何处理流水线。
Eye gaze estimation and simultaneous semantic understanding of a user through eye images is a crucial component in Virtual and Mixed Reality; enabling energy efficient rendering, multi-focal displays and effective interaction with 3D content. In head-mounted VR/MR devices the eyes are imaged off-axis to avoid blocking the user's gaze, this view-point makes drawing eye related inferences very challenging. In this work, we present EyeNet, the first single deep neural network which solves multiple heterogeneous tasks related to eye gaze estimation and semantic user understanding for an off-axis camera setting. The tasks include eye segmentation, blink detection, emotive expression classification, IR LED glints detection, pupil and cornea center estimation. To train EyeNet end-to-end we employ both hand labelled supervision and model based supervision. We benchmark all tasks on MagicEyes, a large and new dataset of 587 subjects with varying morphology, gender, skin-color, make-up and imaging conditions.
研究动机与目标
- 开发一种统一的深度学习框架,用于在非轴向头戴式显示器中同时实现视线估计与语义用户理解。
- 通过端到端学习表示,消除对人工设计的计算机视觉流水线在反光点与瞳孔检测中的依赖。
- 通过在异构任务间共享特征学习,提升资源受限的增强现实/混合现实(AR/MR)环境中的鲁棒性与效率。
- 在包含性别、肤色与成像条件差异的大型多样化数据集上进行性能基准测试。
- 仅使用一个计算高效的网络,实现视线、眨眼、表情与眼部解剖结构的精确实时估计。
提出的方法
- EyeNet 采用基于 ResNet50 的多任务学习架构,联合优化眼部分割、眨眼检测、情绪表情分类、红外反光点检测以及瞳孔/角膜中心估计。
- 网络同时使用人工标注监督与基于眼动几何推导的模型监督,以提升角膜中心与视线估计的准确性。
- 共享主干网络提取特征后,分支输出多个预测结果,实现参数共享与计算效率。
- 模型在 MagicEyes 数据集上端到端训练,该数据集包含 587 名受试者,涵盖多样的形态、性别、肤色与成像条件。
- 后处理使用标准梯度下降优化,以网络提供的初始估计值为起点,进一步优化三维视线估计。
- 通过使用 160x120 输入分辨率与 ResNet50,对架构进行推理速度优化(单次前向传播平均 12ms),以支持在 AR/MR 硬件上的部署。
实验结果
研究问题
- RQ1单一深度神经网络能否有效解决非轴向视线估计与用户理解中的多种异构任务?
- RQ2在基于外观与几何的任务之间共享表示学习,是否能提升视线估计的鲁棒性与准确性?
- RQ3基于眼动几何推导的模型监督是否能在无需人工设计启发式规则的前提下提升视线估计精度?
- RQ4仅使用眼部区域数据时,多任务学习对眨眼检测与情绪表情分类性能有何影响?
- RQ5统一网络在保持高精度的同时,能在多大程度上降低计算负载,以支持实时 AR/MR 应用?
主要发现
- 在 25 名受试者的测试集上,EyeNet 的眨眼检测误报率为 1.24%,漏报率为 4.01%,优于以往工作(分别为 8.3% 与 16.7%)。
- 情绪表情分类的整体准确率达到 92.75%,其中中性表情分类准确率为 94.92%,快乐表情为 93.74%。
- 在 GPU 上推理速度达 83fps(平均 12ms/次前向传播),适用于 AR/MR 设备的实时部署。
- 使用基于模型的监督显著提升了视线估计精度,使高质量角膜中心预测成为可能。
- 多任务架构减少了对手动设计组件的依赖,提升了可维护性与可扩展性。
- 模型在多样化人群(包括性别、肤色与化妆差异)中表现出强大的泛化能力,经 MagicEyes 数据集验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。