[论文解读] GhostVLAD for set-based face recognition
本文提出GhostVLAD,一种新型神经网络层,通过将人脸描述符聚合为紧凑的固定长度表示,增强了基于集合的人脸识别。通过引入‘幽灵聚类’,该方法可吸收低质量图像而不参与聚合,模型自动学习降低噪声输入的权重,在IJB-B和IJB-A上实现SOTA性能,使用128维模板。
The objective of this paper is to learn a compact representation of image sets for template-based face recognition. We make the following contributions: first, we propose a network architecture which aggregates and embeds the face descriptors produced by deep convolutional neural networks into a compact fixed-length representation. This compact representation requires minimal memory storage and enables efficient similarity computation. Second, we propose a novel GhostVLAD layer that includes {\em ghost clusters}, that do not contribute to the aggregation. We show that a quality weighting on the input faces emerges automatically such that informative images contribute more than those with low quality, and that the ghost clusters enhance the network's ability to deal with poor quality images. Third, we explore how input feature dimension, number of clusters and different training techniques affect the recognition performance. Given this analysis, we train a network that far exceeds the state-of-the-art on the IJB-B face recognition dataset. This is currently one of the most challenging public benchmarks, and we surpass the state-of-the-art on both the identification and verification protocols.
研究动机与目标
- 解决在图像质量差异显著的非约束环境下基于模板的人脸识别挑战。
- 开发图像集的紧凑、固定长度表示,以实现高效的相似度计算和最小内存占用。
- 通过学习加权信息量更高的图像而非低质量图像,提升模板描述符的判别能力。
- 设计一种机制,自动降低无信息量或噪声图像的权重,无需显式监督。
- 仅使用身份级别标签,在具有挑战性的IJB-B和IJB-A基准上实现SOTA性能。
提出的方法
- 提出GhostVLAD层,通过引入‘幽灵聚类’(即接收软分配但不参与最终描述符聚合的聚类)扩展NetVLAD。
- 利用每个聚类的残差向量,按分配概率加权后组合,形成最终的紧凑描述符。
- 使用仅身份级别标签进行端到端训练,实现基于图像质量自动学习人脸重要性。
- 将GhostVLAD集成到基于ResNet的主干网络(如SE-ResNet-50)中,该网络在MS-Celeb-1M上预训练,并在VGGFace2上微调。
- 通过残差向量的范数衡量每张输入图像对最终模板的贡献,实现学习到的注意力可视化。
- 使用标准基准IJB-A和IJB-B,同时优化验证(ROC)和识别(DET)性能。
实验结果
研究问题
- RQ1深度学习架构能否在无显式监督的情况下,自动学习降低低质量人脸图像在集合中的重要性?
- RQ2幽灵聚类的引入如何影响模板表示在人脸识别中的判别能力和鲁棒性?
- RQ3输入特征维度、聚类数量和训练技术对基于集合的人脸识别性能有何影响?
- RQ4紧凑的128维模板表示能否在准确率和效率方面超越更大的2048维表示?
- RQ5所提方法是否在最具挑战性的公开基准IJB-B和IJB-A上实现了SOTA性能?
主要发现
- GhostVLAD在IJB-B验证任务中,FAR=1e-5时达到TAR=0.762,优于之前的SOTA(0.705)。
- 在IJB-B识别任务中,FPIR=0.01时达到TPIR=0.776,优于先前SOTA(0.743)。
- 即使仅在VGGFace2上训练(未使用MS-Celeb-1M),该方法在IJB-B上仍达到TAR=0.762(FAR=1e-5),而先前SOTA为0.671。
- 网络生成128维模板,显著小于先前SOTA方法的2048-D模板,实现更快推理和更低内存占用。
- 定性分析表明,幽灵聚类减少了模糊和低分辨率图像对最终模板的贡献,提升了信噪比。
- 尽管使用更浅的主干网络和更小的模板尺寸,该网络在IJB-A验证任务上仍优于更深的ResNet方法[44]。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。