[论文解读] L2CS-Net: Fine-Grained Gaze Estimation in Unconstrained Environments
L2CS-Net 提出了一种基于 CNN 的新型眼动估计模型,通过使用两个相同、双损失的分支分别回归偏航角和俯仰角,以提升在非约束环境下的准确性和泛化能力。通过在 softmax 层上结合 ℓ₂ 回归损失与交叉熵分类损失以进行眼动分箱预测,该模型在 MPIIGaze 数据集上实现了 3.92° 的平均角度误差,在 Gaze360 数据集上实现了 10.41° 的误差,达到当前最优性能。
Human gaze is a crucial cue used in various applications such as human-robot interaction and virtual reality. Recently, convolution neural network (CNN) approaches have made notable progress in predicting gaze direction. However, estimating gaze in-the-wild is still a challenging problem due to the uniqueness of eye appearance, lightning conditions, and the diversity of head pose and gaze directions. In this paper, we propose a robust CNN-based model for predicting gaze in unconstrained settings. We propose to regress each gaze angle separately to improve the per-angel prediction accuracy, which will enhance the overall gaze performance. In addition, we use two identical losses, one for each angle, to improve network learning and increase its generalization. We evaluate our model with two popular datasets collected with unconstrained settings. Our proposed model achieves state-of-the-art accuracy of 3.92° and 10.41° on MPIIGaze and Gaze360 datasets, respectively. We make our code open source at https://github.com/Ahmednull/L2CS-Net.
研究动机与目标
- 提升在光照、头部姿态和眼部外观显著变化的非约束环境下眼动估计的准确性。
- 解决单损失 CNN 在多样化真实世界条件下泛化能力不足的问题。
- 通过使用独立的全连接层解耦偏航角与俯仰角的回归,提升各角度预测的准确性。
- 通过结合回归与分类的双损失机制,提升网络的泛化能力。
- 在两个主要非约束数据集(MPIIGaze 和 Gaze360)上验证模型的鲁棒性。
提出的方法
- 使用在 ImageNet 上预训练的 ResNet-50 主干网络,从眼或人脸图像中提取特征。
- 采用两个独立的全连接层,分别独立预测偏航角与俯仰角,实现对各角度的精细化优化。
- 采用双损失策略:每个眼动角度由 ℓ₂ 回归损失与离散眼动分箱的交叉熵损失联合监督。
- 通过 softmax 层预测眼动分箱的概率,提升对角度预测误差的鲁棒性。
- 同时反向传播两种损失,联合优化回归与分类分支。
- 在训练过程中调节回归损失系数(β),以平衡两种损失分量,实现最优性能。

实验结果
研究问题
- RQ1分别回归偏航角与俯仰角是否能提升非约束环境下眼动估计的准确性?
- RQ2结合回归与分类损失是否能增强模型在不同光照、姿态与眼部外观条件下的泛化能力?
- RQ3与单损失基线相比,所提出的双损失架构在鲁棒性与准确性方面表现如何?
- RQ4通过 softmax 进行眼动分箱分类是否能提升真实场景中角度预测的稳定性?
- RQ5在非约束环境下,回归与分类损失之间最优的权衡是什么?
主要发现
- L2CS-Net 在 MPIIGaze 数据集上实现了 3.92° 的最先进平均角度误差,优于表 1 中列出的所有先前方法。
- 在 Gaze360 数据集上,L2CS-Net 在前 180° 评估中实现了 10.41° 的平均角度误差,创下新的 SOTA 基准。
- 在 Gaze360 的前向视角子集上,L2CS-Net 实现了 9.02° 的平均角度误差,进一步证明其在受限视角范围内的鲁棒性。
- 在 MPIIGaze 上的个体受试者评估显示,L2CS-Net 在 15 名受试者中的 11 名上优于 FARE-Net,证实了其在个体层面性能的提升。
- 消融实验表明,结合眼动分箱分类的双损失机制显著提升了泛化能力并降低了角度误差。
- 该模型在各种条件下均保持强劲性能,通过 MPIIGaze 的留一受试者交叉验证与 Gaze360 的标准划分验证了其有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。