[论文解读] FAN: Feature Adaptation Network for Surveillance Face Recognition and Normalization
该论文提出FAN(特征自适应网络),通过解耦身份特征与非身份特征,联合执行监控场景下的人脸识别与归一化,支持成对与非成对数据的联合训练。该方法在SCface、WIDER FACE和QUML-SurvFace数据集上实现了最先进性能,得益于解耦特征学习与随机尺度增强策略,显著提升了对可变分辨率输入的鲁棒性。
This paper studies face recognition (FR) and normalization in surveillance imagery. Surveillance FR is a challenging problem that has great values in law enforcement. Despite recent progress in conventional FR, less effort has been devoted to surveillance FR. To bridge this gap, we propose a Feature Adaptation Network (FAN) to jointly perform surveillance FR and normalization. Our face normalization mainly acts on the aspect of image resolution, closely related to face super-resolution. However, previous face super-resolution methods require paired training data with pixel-to-pixel correspondence, which is typically unavailable between real-world low-resolution and high-resolution faces. FAN can leverage both paired and unpaired data as we disentangle the features into identity and non-identity components and adapt the distribution of the identity features, which breaks the limit of current face super-resolution methods. We further propose a random scale augmentation scheme to learn resolution robust identity features, with advantages over previous fixed scale augmentation. Extensive experiments on LFW, WIDER FACE, QUML-SurvFace and SCface datasets have shown the effectiveness of our method on surveillance FR and normalization.
研究动机与目标
- 解决在低分辨率、非约束图像中监控场景人脸识别与归一化的挑战,其中身份保持至关重要。
- 克服现有面部超分辨率方法依赖像素级一一对应成对训练数据的局限性。
- 通过同时利用成对与非成对数据,实现人脸识别与归一化的联合学习,提升对分辨率变化的鲁棒性。
- 开发一种方法,在增强面部细节的同时保持身份一致性,并缓解姿态、光照与表情变化的影响。
- 提出一种随机尺度增强策略,使模型能够泛化至监控场景中未知且多样的输入分辨率。
提出的方法
- FAN采用两阶段框架:首先,通过编码器-解码器结构在高分辨率图像中进行解耦特征学习,分离出身份与非身份成分。
- 其次,特征自适应在解耦特征空间中对齐低分辨率与高分辨率编码器的身份特征分布,从而支持非成对训练。
- 该方法结合特征层级与图像层级的相似性正则化,以在归一化过程中保持身份一致性并提升识别准确率。
- 提出一种新颖的随机尺度增强(RSA)策略,在训练过程中生成多样化的低分辨率输入,增强模型对监控数据中未知分辨率变化的鲁棒性。
- 框架通过重建损失、身份分类损失与特征分布对齐损失的联合优化进行端到端训练。
- 解码器从低分辨率特征中重建出高分辨率人脸图像,生成视觉质量高且身份保持的输出。
实验结果
研究问题
- RQ1是否存在一种统一框架,可在无需成对训练数据的前提下,同时提升监控图像中的人脸识别与归一化性能?
- RQ2如何将身份特征从非身份因素(如姿态、光照)中解耦,以提升在低分辨率场景下的识别鲁棒性?
- RQ3随机尺度增强在多大程度上提升了模型对未知且可变输入分辨率的泛化能力?
- RQ4在解耦身份空间中进行特征自适应,是否能有效利用非成对数据进行训练,从而克服传统面部超分辨率方法的局限?
- RQ5与最先进方法相比,该方法在识别准确率与归一化人脸的视觉质量方面表现如何?
主要发现
- FAN在SCface测试集上实现了90.3%的最先进rank-1识别准确率,优于所有未经微调的基线方法,且即使在测试时未提供分辨率信息,也超越了DCR方法。
- 在SCface训练集上使用RSA进行微调后,FAN的rank-1准确率达到90.3%,表明其对低质量监控输入具有强大的泛化能力。
- 消融实验表明,移除解码器(Dec)会导致性能下降,证实联合归一化可增强识别任务的特征学习。
- RSA策略显著提升了模型鲁棒性,FAN-FT(使用RSA)相比FAN-FT(无RSA)在rank-1准确率上提升了4.1%。
- FAN能从低分辨率输入生成高质量、身份保持的人脸图像,经SCface与WIDER FACE数据集上的定性对比验证,其面部细节恢复效果优于最先进FSR方法。
- FAN的推理速度(在Titan X GPU上,特征提取耗时0.011秒,图像恢复耗时0.005秒)与FSRNet(0.012秒)相当,远快于CBN(3.84秒),适用于实时监控应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。