[论文解读] DSFD: Dual Shot Face Detector
本文提出DSFD,一种双阶段人脸检测器,通过特征增强模块(FEM)增强特征表示,采用渐进式锚框损失(PAL)对两个特征流进行多尺度监督,并利用改进的锚框匹配(IAM)实现更优的回归器初始化。DSFD在WIDER FACE(Easy集96.6% AP,Hard集90.4% AP)和FDDB(1,000个误报时86.2% AP)上达到最先进性能,展现出对尺度、遮挡和光照变化的强鲁棒性。
In this paper, we propose a novel face detection network with three novel contributions that address three key aspects of face detection, including better feature learning, progressive loss design and anchor assign based data augmentation, respectively. First, we propose a Feature Enhance Module (FEM) for enhancing the original feature maps to extend the single shot detector to dual shot detector. Second, we adopt Progressive Anchor Loss (PAL) computed by two different sets of anchors to effectively facilitate the features. Third, we use an Improved Anchor Matching (IAM) by integrating novel anchor assign strategy into data augmentation to provide better initialization for the regressor. Since these techniques are all related to the two-stream design, we name the proposed network as Dual Shot Face Detector (DSFD). Extensive experiments on popular benchmarks, WIDER FACE and FDDB, demonstrate the superiority of DSFD over the state-of-the-art face detectors.
研究动机与目标
- 解决在尺度、姿态、遮挡和光照极端变化下检测人脸的挑战。
- 通过增强不同特征层级的判别性和鲁棒性,改进单阶段检测器的特征学习能力。
- 通过渐进式损失和锚框匹配策略缓解类别不平衡问题,并改善回归器初始化。
- 在保持高推理速度的前提下,实现单阶段人脸检测的最先进精度。
提出的方法
- 提出一种特征增强模块(FEM),通过空洞卷积和残差连接融合多层级特征,提升第二阶段检测流的特征表示能力。
- 提出渐进式锚框损失(PAL),在第一阶段使用较小的锚框,第二阶段使用较大的锚框,实现在不同检测层级和阶段的渐进式监督。
- 通过引入锚框划分和基于锚框的数据增强,设计改进的锚框匹配(IAM),以优化正样本锚框的分配和回归器初始化。
- 采用双流检测架构,第一流使用原始特征,第二流使用增强后的特征,两者均通过PAL进行监督。
- 使用VGG/ResNet主干网络,在最后一个卷积块后插入FEM,为第二检测流生成增强特征。
- 通过图像金字塔实现多尺度推理,并在FDDB评估中应用后处理椭圆回归。
实验结果
研究问题
- RQ1具备增强特征学习能力的双阶段检测框架是否能提升在具有挑战性的人脸检测基准上的性能?
- RQ2在两个检测阶段之间采用渐进式损失设计,是否能带来更好的特征学习和检测精度?
- RQ3通过数据增强和划分改进锚框匹配,是否能减少初始化偏差并提升回归器性能?
- RQ4所提方法在精度和鲁棒性方面与当前最先进的一阶段人脸检测器相比如何?
主要发现
- 在WIDER FACE验证集上,DSFD在Easy集上达到96.6%平均精度(AP),Medium集为95.7%,Hard集为90.4%。
- 在WIDER FACE测试集上,DSFD在Easy集上达到96.0% AP,Medium集为95.3%,Hard集为90.0%,优于先前最先进方法。
- 在FDDB基准上,DSFD在1,000个误报时,连续ROC曲线达到86.2%,非连续ROC曲线达到99.1%。
- 在增加额外标注后,DSFD的误报率进一步降低,在FDDB上全面超越所有其他方法。
- 使用更大的批量大小(LargeBS)时,DSFD在WIDER FACE Hard集上达到91.2% AP,表明在数据增强下具有强大的泛化能力。
- 使用ResNet-50主干网络时,DSFD在单张NVIDIA P40 GPU上对VGA分辨率输入实现22 FPS的推理速度,展现出高效的推理性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。