[论文解读] Data Uncertainty Learning in Face Recognition
本文首次在概率潜在空间中联合学习特征嵌入(均值)与不确定性(方差),提出数据不确定性学习(DUL)用于人脸识别。通过端到端训练均值与方差,DUL 提升了类内紧凑性与类间可分性,在无约束基准测试中优于确定性模型及先前工作 PFE,尤其在噪声条件下表现更优。
Modeling data uncertainty is important for noisy images, but seldom explored for face recognition. The pioneer work, PFE, considers uncertainty by modeling each face image embedding as a Gaussian distribution. It is quite effective. However, it uses fixed feature (mean of the Gaussian) from an existing model. It only estimates the variance and relies on an ad-hoc and costly metric. Thus, it is not easy to use. It is unclear how uncertainty affects feature learning. This work applies data uncertainty learning to face recognition, such that the feature (mean) and uncertainty (variance) are learnt simultaneously, for the first time. Two learning methods are proposed. They are easy to use and outperform existing deterministic methods as well as PFE on challenging unconstrained scenarios. We also provide insightful analysis on how incorporating uncertainty estimation helps reducing the adverse effects of noisy samples and affects the feature learning.
研究动机与目标
- 为解决现有人脸识别模型将嵌入视为确定性点的问题,忽略噪声或低质量图像中固有的数据级不确定性。
- 克服先前工作 PFE 的局限性,其固定均值嵌入仅学习方差,限制了联合优化,并需使用复杂的相似性度量。
- 提出统一框架,同时学习身份特征(均值)及其不确定性(方差),从而可使用标准相似性度量(如余弦距离)。
- 分析学习到的不确定性如何影响模型训练,特别是减轻噪声样本在优化过程中的负面影响。
- 在图像质量退化的真实世界无约束人脸识别基准上,展示改进的鲁棒性与性能。
提出的方法
- 提出 DUL cls,一种基于分类的方法,从零开始训练人脸识别模型,输出为高斯分布,其中均值(μ)与方差(σ)均端到端优化。
- 提出 DUL rgs,一种基于回归的方法,通过添加方差头对预训练的人脸识别模型进行微调,实现 μ 与 σ 的联合学习。
- 使用变分推断目标,引入 KL 散度项以正则化不确定性估计,平衡表示能力与泛化性能。
- 采用改进的 AM-Softmax 损失,引入超参数 λ 控制 KL 散度对方差估计的影响,实现不确定性分配的自适应调整。
- 推理阶段使用标准余弦相似度,无需像 PFE 那样使用复杂的互似然得分(MLS)。
- 训练过程中应用数据增强与噪声注入,以模拟真实世界图像退化,评估模型鲁棒性。
实验结果
研究问题
- RQ1与确定性模型相比,联合学习特征均值与不确定性在人脸识别性能上是否有所提升?
- RQ2端到端学习均值与方差是否能改善潜在空间中的类内紧凑性与类间可分性?
- RQ3学习到的不确定性如何影响模型训练,特别是是否能降低噪声或低质量训练样本的负面影响?
- RQ4当训练数据包含显著图像噪声或标签错误时,所提方法是否仍能保持或提升性能?
- RQ5该方法是否能在不使用 MLS 等专用度量的情况下,通过标准相似性度量实现最先进性能?
主要发现
- DUL cls 与 DUL rgs 在所有主要基准测试(包括 YTF、MegaFace 与 IJB-C)中均优于确定性模型与 PFE,尤其在低质量图像数据集上提升最大。
- 在 IJB-C 基准上,DUL cls 实现 TPR@FPR 为 92.78%(λ=0.01),显著优于 PFE 的 91.33% 与基线的 88.65%。
- 在 MS-Celeb-1M 数据集上以 40% 高斯模糊噪声进行训练时,DUL cls 在 IJB-C 上保持 95.85% 准确率,优于 PFE 的 94.82% 与基线的 93.73%。
- 超参数 λ 控制不确定性表示能力:过低(λ=0)导致近似确定性预测,过高(λ=1.0)则使所有样本被分配大方差,导致性能下降。
- 定性分析表明,DUL cls 为噪声样本分配更大方差,为清晰样本分配更小方差,从而提升鲁棒性与特征质量。
- 该方法可直接使用标准余弦相似度进行推理,无需像 PFE 那样使用计算成本高昂的互似然得分(MLS)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。