[论文解读] Facial Pose Estimation by Deep Learning from Label Distributions
本文提出一种深度学习方法,通过将姿态回归建模为标签分布学习,利用高斯标签分布损失来提升在数据不平衡数据集上的泛化能力。通过在AFLW和300W-LP上使用该损失训练卷积神经网络,该方法在AFLW2000和BIWI等基准测试中实现了最先进性能,将平均绝对误差(MAE)降低了最多13.8%。
Facial pose estimation has gained a lot of attentions in many practical applications, such as human-robot interaction, gaze estimation and driver monitoring. Meanwhile, end-to-end deep learning-based facial pose estimation is becoming more and more popular. However, facial pose estimation suffers from a key challenge: the lack of sufficient training data for many poses, especially for large poses. Inspired by the observation that the faces under close poses look similar, we reformulate the facial pose estimation as a label distribution learning problem, considering each face image as an example associated with a Gaussian label distribution rather than a single label, and construct a convolutional neural network which is trained with a multi-loss function on AFLW dataset and 300W-LP dataset to predict the facial poses directly from color image. Extensive experiments are conducted on several popular benchmarks, including AFLW2000, BIWI, AFLW and AFW, where our approach shows a significant advantage over other state-of-the-art methods.
研究动机与目标
- 解决现有数据集(如AFLW和300W-LP)中大角度面部姿态训练数据不足的挑战。
- 克服标准Softmax交叉熵损失的局限性,该损失无法利用相邻姿态之间的相似性。
- 通过将姿态标签建模为连续分布而非离散单标签,提升姿态估计的准确性。
- 证明基于高斯约束的标签分布学习可增强模型鲁棒性与泛化能力,尤其在稀有或大角度姿态上表现更优。
提出的方法
- 将面部姿态估计重新表述为标签分布学习问题,其中每张人脸图像关联一个以真实姿态为中心的高斯分布标签。
- 定义一种新颖的高斯标签分布损失,鼓励预测结果接近真实姿态,并在相邻姿态上平滑衰减。
- 使用结合高斯标签分布损失与标准回归损失的多损失函数训练卷积神经网络。
- 利用AFLW和300W-LP数据集中的数据,端到端训练模型,直接回归偏航角、俯仰角和翻滚角。
- 引入超参数α以控制高斯分布的宽度,实现定位精度与泛化能力之间的权衡。
- 将训练好的模型应用于多个基准测试(包括AFLW2000、BIWI、AFLW和AFW),通过偏航角、俯仰角、翻滚角和MAE指标评估性能。
实验结果
研究问题
- RQ1将面部姿态建模为标签分布而非单个标签,是否能提升在数据不平衡数据集上的性能?
- RQ2在相邻姿态之间引入基于高斯的相似性约束,是否能降低姿态估计误差,特别是在代表性不足的大角度姿态上?
- RQ3与标准Softmax交叉熵损失和回归损失相比,所提出的标签分布损失在鲁棒性与准确性方面表现如何?
- RQ4该方法在AFLW2000、BIWI和AFW等多样化基准测试中的泛化能力如何?
- RQ5为何在翻滚角估计上的性能提升幅度小于偏航角和俯仰角?这是否可归因于数据不平衡?
主要发现
- 所提方法在AFLW2000基准上实现最先进性能,相比最佳基线方法(Hopenet)将MAE降低了13.8%。
- 在BIWI基准上,该方法相比Hopenet将俯仰角MAE降低19.4%,偏航角降低20.8%,整体MAE降低13.8%。
- 在AFLW基准上,最佳模型(α=0.01)相比Hopenet将偏航角误差降低4.2%,俯仰角降低9.85%,MAE降低5.71%。
- 在AFW基准上,该方法准确率超过99%,优于所有基线方法,包括Hopenet和KEPLER。
- α=0.01的模型在精度与泛化能力之间达到最佳平衡,各项指标和数据集上均表现出一致改进。
- 翻滚角估计的性能差距大于偏航角和俯仰角,主要归因于翻滚域存在极端数据不平衡,AFLW中65.57%、BIWI中67.65%的样本集中在±10°范围内。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。