Skip to main content
QUICK REVIEW

[论文解读] Efficient CNN Implementation for Eye-Gaze Estimation on Low-Power/Low-Quality Consumer Imaging Systems

Joseph Lemley, Anuradha Kar|arXiv (Cornell University)|Jun 28, 2018
Gaze Tracking and Assistive Technology参考文献 52被引用 12
一句话总结

本文提出一种轻量化、面向硬件优化的卷积神经网络(CNN),用于在低功耗、低分辨率的消费级摄像头上实现高效的眼动估计。通过采用双目输入和随机缩放数据增强技术,该模型在MPII-Gaze数据集上实现了3.65°的最先进准确率,计算成本极低,在真实世界非约束条件下优于更大的网络及现有方法。

ABSTRACT

Accurate and efficient eye gaze estimation is important for emerging consumer electronic systems such as driver monitoring systems and novel user interfaces. Such systems are required to operate reliably in difficult, unconstrained environments with low power consumption and at minimal cost. In this paper a new hardware friendly, convolutional neural network model with minimal computational requirements is introduced and assessed for efficient appearance-based gaze estimation. The model is tested and compared against existing appearance based CNN approaches, achieving better eye gaze accuracy with significantly fewer computational requirements. A brief updated literature review is also provided.

研究动机与目标

  • 开发一种低复杂度、实时的眼动估计系统,适用于部署在低功耗、低质量的消费级成像设备上。
  • 解决在非约束环境下,由于受试者距离变化和低分辨率输入导致的准确率下降问题。
  • 在不增加模型大小或推理成本的前提下,通过双目输入和数据增强技术提升眼动估计性能。
  • 设计一种针对嵌入式和移动平台典型内存与速度限制而优化的CNN架构。
  • 在MPII-Gaze基准测试中,证明其准确率优于现有基于CNN的眼动估计方法。

提出的方法

  • 采用双通道CNN架构,同时处理左眼和右眼图像,以提升鲁棒性和准确性。
  • 通过堆叠3×3卷积层形成模块,减少参数量和计算负载,同时保持与大感受野核等效的感受野。
  • 在训练过程中应用随机缩放,使用最近邻插值模拟不同受试者距离,增强模型鲁棒性。
  • 在推理阶段使用Lanczos滤波以保持图像质量,避免特定插值方法带来的偏差。
  • 通过多种分辨率(如36×60、31×52、26×16)的数据增强,提升模型在真实世界观看距离下的泛化能力。
  • 将网络训练为回归任务,直接从低分辨率眼图像预测眼动角度(φ, θ)。

实验结果

研究问题

  • RQ1紧凑且面向硬件优化的CNN是否能在低分辨率、消费级摄像头上实现高精度的眼动估计?
  • RQ2在低质量成像条件下,双目输入相比单眼输入在眼动估计性能上有多大提升?
  • RQ3在数据增强中使用随机缩放,能在多大程度上提升模型对受试者距离变化的鲁棒性?
  • RQ4轻量化CNN架构是否能在真实世界眼动估计任务中,以更高的准确率和效率超越更大、更复杂的模型?
  • RQ5卷积核大小和网络深度对眼动估计中准确率和计算效率的影响如何?

主要发现

  • 所提出的模型在36×60分辨率下于MPII-Gaze数据集上实现了3.65°的平均眼动误差,显著优于先前的最先进方法。
  • 双目输入通过帮助网络解析低质量眼图像中的模糊信息,显著提升了准确性,尤其在光照不良或遮挡情况下。
  • 通过在多种分辨率下进行随机缩放的数据增强,将误差从4.917°降低至3.65°,表明模型对受试者距离具有强鲁棒性。
  • 该模型在多种分辨率下均保持高性能,31×52分辨率下误差为4.169°,26×16分辨率下为4.240°,显示出对下采样的强鲁棒性。
  • 使用堆叠的3×3卷积层替代大感受野核,显著降低了FLOPs和模型大小,同时保持性能,验证了架构的高效性。
  • 该模型性能超越了文献中更大的网络(包括误差达4.8°的模型),证明紧凑性与高效性并不以牺牲准确率为代价。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。