[论文解读] Towards Interpretable Face Recognition
本文提出了一种基于损失的新型训练方法,用于可解释的人脸识别,通过空间激活多样性损失和特征激活多样性损失,促使卷积滤波器在特定且一致的人脸部位(如眼睛、鼻子)上激活。该方法在保持性能的同时,实现了最先进的面部识别准确率,并生成高度可解释、抗遮挡的表征。
Deep CNNs have been pushing the frontier of visual recognition over past years. Besides recognition accuracy, strong demands in understanding deep CNNs in the research community motivate developments of tools to dissect pre-trained models to visualize how they make predictions. Recent works further push the interpretability in the network learning stage to learn more meaningful representations. In this work, focusing on a specific area of visual recognition, we report our efforts towards interpretable face recognition. We propose a spatial activation diversity loss to learn more structured face representations. By leveraging the structure, we further design a feature activation diversity loss to push the interpretable representations to be discriminative and robust to occlusions. We demonstrate on three face recognition benchmarks that our proposed method is able to improve face recognition accuracy with easily interpretable face representations.
研究动机与目标
- 开发一种方法,学习可解释的人脸表征,使每个滤波器响应对应于一致的人脸部位。
- 解决先前可解释CNN研究中观察到的可解释性与识别准确率之间的权衡问题。
- 通过利用结构化、部件化的表征,提高对遮挡的鲁棒性。
- 在不引入模型依赖性约束的前提下,通过模型无关的损失函数实现端到端训练,以增强可解释性。
提出的方法
- 引入空间激活多样性损失,以促使滤波器仅对局部人脸部位产生响应,减少广泛分布的非特定激活。
- 设计特征激活多样性损失,以对齐同一身份在不同图像中的滤波器响应,增强判别能力。
- 在标准人脸识别架构(如ResNet50、CASIA-Net)上,通过端到端训练同时应用两种损失,无需架构修改。
- 利用滤波器响应模式定义部件特定特征(如“鼻子滤波器”),用于下游任务(如部分人脸检索)。
- 通过滤波器间峰值激活位置的分析,识别并分离语义人脸组件,以实现可解释性。
- 使用身份级别特征之间的余弦距离,评估在检索和验证任务中的表现。
实验结果
研究问题
- RQ1我们能否训练深度CNN,使其学习到可解释的人脸表征,使每个滤波器响应对应于一致的人脸部位?
- RQ2通过损失函数引入可解释性是否会导致识别准确率相比标准训练下降?
- RQ3可解释的表征是否能提升人脸识别在遮挡情况下的鲁棒性?
- RQ4所学习的滤波器结构在多大程度上可支持下游任务(如部分人脸检索)?
- RQ5与先前的可解释性方法相比,所提出的损失在性能和可解释性方面表现如何?
主要发现
- 所提方法在IJB-A基准上实现了最先进的验证准确率(FAR=0.01时为98.2%),优于基线ResNet50和先前SOTA方法。
- 在IJB-C数据集上,该方法在FAR=0.01时达到96.0%的验证准确率,与或超过SOTA模型的性能。
- 使用CASIA-Net主干网络的模型在IJB-A数据集上将识别性能提升了1.9%(Rank-1准确率从86.0%提升至87.9%),表明其鲁棒性增强。
- 在遮挡人脸数据集上,该方法表现出显著的性能提升——例如,在AR数据集上佩戴眼镜和围巾时,EER降低3.9%,优于CASIA-Net(EER为21.6%)。
- 利用部件化特征进行部分人脸检索,眼睛的Rank-1准确率为71%,嘴巴为58%,鼻子为69%,证实了可解释滤波器的实用性。
- 该方法在引入强可解释性的同时保持或提升了准确率,打破了可解释性与性能之间常见的权衡关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。