[论文解读] Video Face Recognition: Component-wise Feature Aggregation Network (C-FAN)
本文提出C-FAN,一种逐分量特征聚合网络,通过为深度特征分量学习自适应质量分数,实现对视频帧中高质量面部特征的选择性聚合,从而提升视频人脸识别性能。该方法在IJB-S、YouTube Faces和IJB-A基准上实现最先进性能,相较于平均池化和实例级聚合方法,使用512维紧凑表征实现更优表现。
We propose a new approach to video face recognition. Our component-wise feature aggregation network (C-FAN) accepts a set of face images of a subject as an input, and outputs a single feature vector as the face representation of the set for the recognition task. The whole network is trained in two steps: (i) train a base CNN for still image face recognition; (ii) add an aggregation module to the base network to learn the quality value for each feature component, which adaptively aggregates deep feature vectors into a single vector to represent the face in a video. C-FAN automatically learns to retain salient face features with high quality scores while suppressing features with low quality scores. The experimental results on three benchmark datasets, YouTube Faces, IJB-A, and IJB-S show that the proposed C-FAN network is capable of generating a compact feature vector with 512 dimensions for a video sequence by efficiently aggregating feature vectors of all the video frames to achieve state of the art performance.
研究动机与目标
- 为解决监控中噪声多、画质差的视频帧问题,通过自适应特征聚合改进面部表征学习。
- 开发一种方法,选择性保留具有判别性的面部特征,同时抑制低画质帧中的不可靠分量。
- 通过预测每个分量的质量分数来建模特征级质量差异,而非对整个特征向量应用统一权重。
- 通过以保留时序和多视角信息的方式融合多帧信息,实现鲁棒的视频人脸识别。
- 在包括IJB-S、YouTube Faces和IJB-A在内的标准基准数据集上展示最先进性能。
提出的方法
- 该方法使用预训练的基础CNN进行静态图像人脸识别,随后引入一种新颖的聚合模块,用于预测深度特征向量中每个分量的质量分数。
- 聚合模块对每个分量应用学习到的、逐分量的权重,计算特征分量的加权平均,其中每个权重反映该分量的可靠性。
- 质量分数通过端到端训练,损失函数设计为鼓励对高质量帧中的分量赋予更高权重,对噪声或信息量少的分量赋予更低权重。
- 网络首先在大规模静态图像数据集(如MS-Celeb-1M)上进行预训练,然后通过合成模板进行微调,以学习分量特定的质量分数。
- 推理阶段,同一网络对视频序列中所有帧的每个特征分量独立应用学习到的质量分数进行聚合。
- 最终的面部表征为从所有帧特征的逐分量加权平均中得到的紧凑512维向量。
实验结果
研究问题
- RQ1与平均池化或实例级加权相比,使用可学习质量分数的逐分量特征聚合是否能提升视频人脸识别性能?
- RQ2预测的质量分数是否与视觉图像质量及面部信息含量相关?
- RQ3该方法在具有不同噪声水平、姿态变化和遮挡的多样化视频数据集上是否具备泛化能力?
- RQ4该网络是否能在IJB-S、YouTube Faces和IJB-A等标准基准上实现最先进性能?
- RQ5在开放集和闭集识别协议下,尤其在具有挑战性的监控条件下,该方法表现如何?
主要发现
- C-FAN在IJB-S数据集上实现最先进性能,1% FPIR识别率为86.88% ± 4.70%,10% FPIR率为92.85% ± 1.02%,优于先前方法。
- 在YouTube Faces数据集上,C-FAN达到96.50% ± 0.90%的验证准确率,较先前最先进方法NAN高出0.78%。
- 在IJB-A数据集上,C-FAN在闭集协议下实现94.57% ± 0.82%的rank-1识别准确率,在1% FPIR下开放集协议准确率为86.88% ± 4.70%。
- 逐分量聚合策略在所有基准上显著优于平均池化和实例级特征加权,证明了逐分量注意力机制的优势。
- 预测的质量分数与视觉图像质量具有强相关性,经定性分析和消融研究验证。
- 该方法在IJB-S基准的全部五个面部识别协议上均实现一致提升,证实其在具有挑战性的监控场景中的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。