[论文解读] Appearance-Based 3D Gaze Estimation with Personal Calibration.
本文提出了一种基于外观的3D注视估计方法,通过将个人校准整合到深度学习模型中,利用六个眼特异性参数(每只眼三个)将精度提升了2.2–2.5倍。通过预测3D注视射线(起点和方向),该模型增强了泛化能力,并在MPIIGaze数据集上优于针对个体的基线模型,即使现有数据中注视的3D信息是欠定的。
We propose a way to incorporate personal calibration into a deep learning model for video-based gaze estimation. Using our method, we show that by calibrating six parameters per person, accuracy can be improved by a factor of 2.2 to 2.5. The number of personal parameters, three per eye, is similar to the number predicted by geometrical models. When evaluated on the MPIIGaze dataset, our estimator performs better than person-specific estimators. To improve generalization, we predict gaze rays in 3D (origin and direction of gaze). In existing datasets, the 3D gaze is underdetermined, since all gaze targets are in the same plane as the camera. Experiments on synthetic data suggest it would be possible to learn accurate 3D gaze from only annotated gaze targets, without annotated eye positions.
研究动机与目标
- 通过将个人校准整合到深度学习模型中,提升基于视频的注视估计精度。
- 通过预测3D注视射线(起点和方向)而非2D注视向量,减少对精确眼位标注的依赖。
- 通过仅从标注的注视目标学习3D注视表征,而不需眼位标注,提升模型泛化能力。
- 证明即使在真实世界数据集将注视目标限制在单一平面的情况下,3D注视估计仍可被有效学习。
提出的方法
- 该模型使用深度神经网络从单目视频输入预测3D注视射线(起点和方向),相比2D注视估计,能实现更好的泛化能力。
- 通过六个可学习参数(每只眼三个)实现个人校准,调整模型对个体眼特征的内部表征。
- 网络在MPIIGaze数据集上进行训练,其中注视目标被限制在单一平面,模拟真实世界数据的限制。
- 合成数据实验表明,仅使用标注的注视目标即可实现准确的3D注视估计,无需标注眼位。
- 3D注视射线预测通过端到端方式优化,使模型能从数据中隐式学习几何约束。
实验结果
研究问题
- RQ1个人校准是否能显著提升深度学习模型中3D注视估计的精度?
- RQ2在不依赖眼位标注的情况下,3D注视估计能在多大程度上仅从标注的注视目标中学习?
- RQ3与预测2D注视向量相比,预测3D注视射线(起点和方向)在泛化能力方面有何提升?
- RQ4当训练数据将所有注视目标限制在单一平面时,深度学习模型能否实现高精度的3D注视估计?
主要发现
- 所提方法相比非校准基线,将注视估计精度提升了2.2至2.5倍。
- 即使采用共享架构并结合个人校准,该模型在MPIIGaze数据集上的表现仍优于个体特定的估计器。
- 合成数据实验表明,仅使用标注的注视目标即可实现准确的3D注视估计,无需眼位标注。
- 预测3D注视射线能带来更好的泛化能力,因为模型能从数据中隐式学习几何约束。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。