[论文解读] End-To-End Face Detection and Recognition
该论文提出一种端到端可训练的卷积神经网络,通过空间变换网络(STN)直接学习几何变换以实现人脸对齐,联合完成人脸检测与识别任务,无需关键点预测。该框架在检测与识别任务间共享低层特征,仅使用边界框和身份标签监督,在FDDB上达到89.24%的召回率,在LFW上达到98.63%的准确率,性能达到当前最先进水平。
Plenty of face detection and recognition methods have been proposed and got delightful results in decades. Common face recognition pipeline consists of: 1) face detection, 2) face alignment, 3) feature extraction, 4) similarity calculation, which are separated and independent from each other. The separated face analyzing stages lead the model redundant calculation and are hard for end-to-end training. In this paper, we proposed a novel end-to-end trainable convolutional network framework for face detection and recognition, in which a geometric transformation matrix was directly learned to align the faces, instead of predicting the facial landmarks. In training stage, our single CNN model is supervised only by face bounding boxes and personal identities, which are publicly available from WIDER FACE \cite{Yang2016} dataset and CASIA-WebFace \cite{Yi2014} dataset. Tested on Face Detection Dataset and Benchmark (FDDB) \cite{Jain2010} dataset and Labeled Face in the Wild (LFW) \cite{Huang2007} dataset, we have achieved 89.24\% recall for face detection task and 98.63\% verification accuracy for face recognition task simultaneously, which are comparable to state-of-the-art results.
研究动机与目标
- 通过可微分的空间变换替代基于关键点的对齐方式,消除对独立人脸对齐阶段的需求。
- 通过在检测与识别任务间共享低层特征,实现人脸检测与识别的端到端训练。
- 通过特征共享减少冗余计算,提升模型效率与性能。
- 仅使用公开可用的监督信号(人脸边界框与身份标签)实现最先进性能。
- 证明在统一的深度学习框架中,基于STN的对齐方法比关键点预测更具灵活性与有效性。
提出的方法
- 该框架基于Faster R-CNN构建用于目标检测,其卷积层之后插入空间变换网络(STN),用于学习特征图的几何变换以实现对齐。
- STN直接预测变换矩阵以对齐特征,无需标注的人脸关键点,从而支持端到端训练。
- 人脸检测与识别分支共享VGG-16的前三个或四个卷积块,降低参数量与计算量。
- 模型仅使用WIDER FACE数据集提供的边界框与CASIA-WebFace数据集提供的身份标签进行端到端训练,无需关键点标注。
- 通过在不同卷积层后切断识别分支,系统性地评估特征共享对性能的影响。
- 训练过程采用多阶段策略:先预训练检测分支,再联合训练检测与识别,最后微调识别头。
实验结果
研究问题
- RQ1空间变换网络能否在端到端的人脸检测与识别框架中有效替代基于关键点的对齐方式?
- RQ2在检测与识别任务间共享低层特征是否能提升模型性能与训练效率?
- RQ3单个CNN模型能否在仅使用边界框与身份标签监督的情况下,于人脸检测与识别任务上均达到最先进性能?
- RQ4特征共享的深度如何影响识别准确率与收敛速度?
- RQ5所提出的端到端框架是否比传统流水线(包含独立的对齐与特征提取阶段)更具鲁棒性与准确性?
主要发现
- 该模型在FDDB人脸检测基准上达到89.24%的召回率,性能与当前最先进方法持平。
- 该模型在LFW人脸验证数据集上达到98.63%的验证准确率,优于现有单模型方法。
- 从第三个卷积块(conv3)共享特征时,识别准确率最高,在LFW上达到98.63%。
- 特征共享显著加快了训练过程中损失的收敛速度,尤其在深层特征共享时效果更明显。
- 基于STN的对齐方法消除了对关键点预测的需求,简化了模型流程,实现了完全的端到端训练。
- 该模型仅使用边界框与身份标签监督即实现高性能,基于公开可用数据集,无需额外标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。