[论文解读] An Automatic System for Unconstrained Video-Based Face Recognition
本文提出了一种鲁棒的、端到端的无约束视频人脸识别系统,整合了多尺度人脸检测、质量感知的人脸关联,以及一种新颖的子空间到子空间相似性度量方法用于识别。该系统在 IJB-B 和 IJB-S 基准测试中达到最先进性能,在 FOCS 上超越人类水平的准确率,并在监控到单张图像和监控到预订的协议中优于 ArcFace,通过利用质量感知的子空间学习和方差感知的匹配方法实现。
Although deep learning approaches have achieved performance surpassing humans for still image-based face recognition, unconstrained video-based face recognition is still a challenging task due to large volume of data to be processed and intra/inter-video variations on pose, illumination, occlusion, scene, blur, video quality, etc. In this work, we consider challenging scenarios for unconstrained video-based face recognition from multiple-shot videos and surveillance videos with low-quality frames. To handle these problems, we propose a robust and efficient system for unconstrained video-based face recognition, which is composed of modules for face/fiducial detection, face association, and face recognition. First, we use multi-scale single-shot face detectors to efficiently localize faces in videos. The detected faces are then grouped respectively through carefully designed face association methods, especially for multi-shot videos. Finally, the faces are recognized by the proposed face matcher based on an unsupervised subspace learning approach and a subspace-to-subspace similarity metric. Extensive experiments on challenging video datasets, such as Multiple Biometric Grand Challenge (MBGC), Face and Ocular Challenge Series (FOCS), IARPA Janus Surveillance Video Benchmark (IJB-S) for low-quality surveillance videos and IARPA JANUS Benchmark B (IJB-B) for multiple-shot videos, demonstrate that the proposed system can accurately detect and associate faces from unconstrained videos and effectively learn robust and discriminative features for recognition.
研究动机与目标
- 解决无约束视频人脸识别中的挑战,包括姿态、光照、模糊和质量在视频内及视频间的大幅变化。
- 开发一种可扩展、高效的系统,能够以最少的人工干预处理高容量视频数据。
- 通过将人脸模板建模为子空间并使用质量与方差感知的相似性度量,提升识别准确率。
- 在 IJB-B 和 IJB-S 等具有挑战性的基准测试中超越现有方法,尤其在低质量与多帧条件下表现更优。
提出的方法
- 采用多尺度单阶段检测器,实现在无约束视频中快速且准确的人脸检测。
- 使用自定义的人脸关联策略,将多帧视频中的人脸进行分组,尤其适用于存在场景和视角变化的多帧视频。
- 通过无监督子空间学习方法,将人脸模板表示为低维子空间,以捕捉样本间的相关性。
- 提出一种质量感知的原型构建方法,在模板表示过程中为高质量帧分配更高权重。
- 应用方差感知投影度量(VPM)计算子空间之间的相似性,提升对外观变化的鲁棒性。
- 将质量感知余弦距离、质量感知子空间学习与方差感知投影度量融合为统一的相似性度量(QCos+QSub-VPM)。
实验结果
研究问题
- RQ1质量感知的子空间表示是否能提升在低质量与无约束视频设置下的人脸识别性能?
- RQ2在子空间相似性度量中引入方差信息,如何影响在多样化视频条件下的识别鲁棒性?
- RQ3在多帧与监控视频中,人脸关联的准确性在多大程度上影响整体识别性能?
- RQ4所提出的子空间到子空间相似性度量是否优于传统的基于原型或嵌入的匹配方法,在开放集视频人脸识别中表现更优?
- RQ5在开放集识别协议下,该系统是否能在具有挑战性的视频基准(如 FOCS)上超越人类水平表现?
主要发现
- 所提系统在 IJB-B 和 IJB-S 基准测试中达到最先进性能,所有协议下的 Rank-1 准确率均有显著提升。
- 在 IJB-S 监控到监控协议中,系统在高分辨率图库协议下优于 ArcFace,并在质量感知匹配下表现出一致的性能增益。
- 消融实验确认,每个组件——质量感知原型、子空间学习与方差感知度量——均逐步贡献于性能提升。
- 系统在 FOCS 数据集上超越人类水平表现,证明其鲁棒性与判别能力。
- 在监控到监控协议中,网络 D 与 E 的融合并未提升性能,可能是因为低质量图库模板的表征能力较差。
- 所提出的 QCos+QSub-VPM 相似性度量在所有数据集和特征类型(包括 ArcFace 特征)上均持续优于基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。