Skip to main content
QUICK REVIEW

[论文解读] Highly accurate gaze estimation using a consumer RGB-depth sensor

Reza Shoja Ghiass, Ognjen Arandjelović|arXiv (Cornell University)|Apr 5, 2016
Gaze Tracking and Assistive Technology参考文献 28被引用 4
一句话总结

本文提出一种使用消费级RGB-D传感器(如Microsoft Kinect)的高精度瞳孔估计方法。通过首先采用自适应优化策略对深度数据进行个性化3D可变形人脸模型拟合,以实现速度与精度的平衡;然后将人脸归一化为正面视图,以实现一致的眼部外观特征提取;最后从这些合成的正面眼图像回归瞳孔方向,该方法在EYEDIAP基准测试中性能优于先前最先进方法超过30%。

ABSTRACT

Determining the direction in which a person is looking is an important problem in a wide range of HCI applications. In this paper we describe a highly accurate algorithm that performs gaze estimation using an affordable and widely available device such as Kinect. The method we propose starts by performing accurate head pose estimation achieved by fitting a person specific morphable model of the face to depth data. The ordinarily competing requirements of high accuracy and high speed are met concurrently by formulating the fitting objective function as a combination of terms which excel either in accurate or fast fitting, and then by adaptively adjusting their relative contributions throughout fitting. Following pose estimation, pose normalization is done by re-rendering the fitted model as a frontal face. Finally gaze estimates are obtained through regression from the appearance of the eyes in synthetic, normalized images. Using EYEDIAP, the standard public dataset for the evaluation of gaze estimation algorithms from RGB-D data, we demonstrate that our method greatly outperforms the state of the art.

研究动机与目标

  • 解决使用低成本、消费级RGB-D传感器实现高精度与实时性能的瞳孔估计挑战。
  • 克服仅依赖RGB数据且需用户校准的传统瞳孔估计方法的局限性。
  • 利用深度数据与个性化3D可变形人脸模型,开发一种鲁棒、快速且精确的头部姿态估计技术。
  • 通过合成正面图像渲染实现头部姿态归一化,实现在自然头部运动下的精确瞳孔估计。
  • 通过在归一化眼图像上进行基于外观的回归,提升泛化能力并降低瞳孔估计误差。

提出的方法

  • 使用类似ICP的优化框架,将个体特定的3D可变形人脸模型拟合到深度数据上。
  • 将拟合目标表述为多项式组合,以平衡精度与速度,并在优化过程中采用自适应加权策略,以同时保证性能与效率。
  • 通过将拟合后的3D人脸模型重新渲染为合成正面图像,实现姿态归一化,消除头部姿态变化的影响。
  • 从合成正面图像中提取眼部外观特征,用于瞳孔估计回归。
  • 使用k-NN或自适应线性回归在归一化的外观特征上训练瞳孔回归模型。
  • 使用EYEDIAP数据集评估方法在头部静止与自然头部运动两种条件下的表现。

实验结果

研究问题

  • RQ1如何通过个性化3D可变形模型,在深度数据中同时实现高精度与高速度的头部姿态估计?
  • RQ2通过合成正面图像渲染实现姿态归一化,对存在头部运动时的瞳孔估计精度有何影响?
  • RQ3在使用消费级RGB-D传感器时,所提方法与最先进方法相比表现如何?
  • RQ4与传统方法相比,基于归一化眼图像的外观回归是否能显著降低瞳孔估计误差?
  • RQ5该方法在自然头部运动下是否保持鲁棒性能,这是真实人机交互应用中的关键挑战?

主要发现

  • 在EYEDIAP数据集上,头部静止条件下,使用自适应线性回归将平均瞳孔方向估计误差降低至7.2°,相比之前最先进方法(10.1°)提升了28.7%。
  • 在自然头部运动条件下,使用自适应线性回归实现平均误差为9.6°,相比之前最先进方法(14.9°)降低了35.6%。
  • 即使采用k-NN回归,所提方法在头部静止条件下误差仍降低22%(7.7° vs. 9.9°),展现出持续优越性。
  • 该方法对头部运动表现出显著更强的鲁棒性,误差仅增加15%(从7.7°增至8.9°),而之前最先进方法误差增加65%(从9.9°增至16.3°)。
  • 自适应优化策略实现实时高精度3D人脸模型拟合,使该方法适用于实际的实时人机交互应用。
  • 在姿态归一化后使用合成正面眼图像,可生成更一致且更具判别力的特征,直接促成性能的提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。