[论文解读] LNSMM: Eye Gaze Estimation With Local Network Share Multiview Multitask
本文提出LNSMM,一种新颖的深度学习框架,通过局部共享网络和多视角多任务学习,实现眼球注视点与注视方向的联合估计。通过利用注视方向的共面约束以及注视点估计中的跨视角池化,该方法在注视点(平均误差3.9°)和注视方向(4.70°)任务上均达到当前最优性能,在自建数据集和公开数据集上均优于现有方法。
Eye gaze estimation has become increasingly significant in computer vision.In this paper,we systematically study the mainstream of eye gaze estimation methods,propose a novel methodology to estimate eye gaze points and eye gaze directions simultaneously.First,we construct a local sharing network for feature extraction of gaze points and gaze directions estimation,which can reduce network computational parameters and converge quickly;Second,we propose a Multiview Multitask Learning (MTL) framework,for gaze directions,a coplanar constraint is proposed for the left and right eyes,for gaze points,three views data input indirectly introduces eye position information,a cross-view pooling module is designed, propose joint loss which handle both gaze points and gaze directions estimation.Eventually,we collect a dataset to use of gaze points,which have three views to exist public dataset.The experiment show our method is state-of-the-art the current mainstream methods on two indicators of gaze points and gaze directions.
研究动机与目标
- 为解决现有注视估计方法将注视点与注视方向估计分开处理、忽略二者相互依赖性的问题。
- 通过联合建模多视角输入下的注视点与注视方向,提升眼动估计的准确性和鲁棒性。
- 通过局部共享网络架构降低模型复杂度并加速收敛。
- 利用多视角数据提升在遮挡和镜面反射等挑战性条件下的性能表现。
- 在新采集的多视角数据集上验证方法,每位受试者包含三个视角,涵盖戴眼镜与不戴眼镜两种情况。
提出的方法
- 设计局部共享网络以同时提取注视点与注视方向估计的特征,减少参数量并提升训练效率。
- 提出多视角多任务学习(MTL)框架,约束左右眼注视方向位于同一平面上。
- 针对注视点估计,设计跨视角池化模块,融合三个视角的特征以隐式编码眼球位置信息。
- 引入联合损失函数,实现注视点与注视方向估计的端到端联合优化。
- 利用多视角输入(三个视角)提升对遮挡和镜面反射的鲁棒性,尤其在戴眼镜场景下表现更优。
- 主干网络基于ResNeXt-36并引入局部权重共享,增强特征表示能力的同时降低计算成本。
实验结果
研究问题
- RQ1如何联合优化注视点与注视方向估计以提升准确性并利用其内在依赖性?
- RQ2多视角输入在降低眼动估计中的噪声与遮挡方面有何影响?
- RQ3局部共享网络架构是否能有效减少模型参数量并加速收敛,同时不损失性能?
- RQ4对左右眼注视方向施加共面约束如何提升估计准确性?
- RQ5所提方法在不同眼部条件(如戴眼镜)下的泛化能力如何?
主要发现
- 所提LNSMM方法在作者自建的多视角数据集上实现3.9°的注视点估计平均误差,优于所有对比方法。
- 在MPIIGaze数据集上,该方法实现4.70°的注视方向估计平均角度误差,优于次优方法0.61°。
- 多视角输入显著提升性能,尤其在戴眼镜受试者中,其遮挡与反光问题更突出,表现更优。
- 局部共享网络(ResNeXt-36)有效降低模型复杂度并加快收敛,其性能优于非共享变体。
- 跨视角池化模块有效整合多视角信息,通过利用眼球位置线索显著提升注视点估计的准确性。
- 对左右眼施加共面约束显著改善注视方向估计,尤其在对称且一致的3D注视建模中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。