[论文解读] Face Detection with Feature Pyramids and Landmarks
本文提出了一种基于单阶段RCNN的面部检测系统,结合特征金字塔与面部关键点回归,采用MobileNetV2和ResNet主干网络,并在WIDER FACE数据集上进行端到端训练。该方法在WIDER FACE hard集上实现了接近最先进水平的面部检测准确率(91.7% AP),同时具备实时推理能力与高精度关键点定位。研究发现,由于随机初始化的影响,上下文模块架构的选择对性能影响甚微。
Accurate face detection and facial landmark localization are crucial to any face recognition system. We present a series of three single-stage RCNNs with different sized backbones (MobileNetV2-25, MobileNetV2-100, and ResNet101) and a six-layer feature pyramid trained exclusively on the WIDER FACE dataset. We compare the face detection and landmark accuracies using eight context module architectures, four proposed by previous research and four modified versions. We find no evidence that any of the proposed architectures significantly overperform and postulate that the random initialization of the additional layers is at least of equal importance. To show this we present a model that achieves near state-of-the-art performance on WIDER FACE and also provides high accuracy landmarks with a simple context module. We also present results using MobileNetV2 backbones, which achieve over 90% average precision on the WIDER FACE hard validation set while being able to run in real-time. By comparing to other authors, we show that our models exceed the state-of-the-art for similar-sized RCNNs and match the performance of much heavier networks.
研究动机与目标
- 开发一种实时、高精度的面部检测系统,并集成面部关键点定位功能。
- 评估不同上下文模块架构对面部检测与关键点定位性能的影响。
- 确定上下文模块的架构设计是否显著影响性能,或随机初始化是否起主导作用。
- 在轻量化、高效模型上实现WIDER FACE数据集上的最先进或接近最先进性能。
- 证明通过优化主干网络的小型模型可在准确率与速度上超越更大、更重的神经网络。
提出的方法
- 模型采用单阶段RCNN结构,通过六层特征金字塔从输入图像中提取多尺度特征。
- 使用三种主干网络——MobileNetV2-25、MobileNetV2-100与ResNet101——在准确率与推理速度之间取得平衡。
- 评估了八种上下文模块架构:四种来自先前工作,四种为改进版本,全部添加至特征金字塔中。
- 面部关键点预测通过一个分支头实现,与检测头在WIDER FACE数据集上端到端联合训练。
- 通过TVM与MxNet结合CUDA加速,在多种硬件(CPU、GPU、嵌入式设备、移动设备)上优化推理速度。
- 模型仅在WIDER FACE数据集上进行训练,未使用数据增强或迁移学习。
实验结果
研究问题
- RQ1上下文模块架构的选择是否显著影响面部检测或关键点定位性能?
- RQ2基于轻量级MobileNetV2的模型能否在WIDER FACE hard集上实现最先进性能,同时实现实时推理?
- RQ3特征金字塔与上下文模块中新增层的随机初始化在多大程度上影响模型性能?
- RQ4关键点回归的集成如何影响检测准确率与模型效率?
- RQ5当与合适的主干网络结合时,简单的上下文模块架构是否能超越更复杂的架构?
主要发现
- 使用ResNet101主干网络的模型在WIDER FACE hard验证集上达到91.7%的平均精度,接近最先进水平。
- MobileNetV2-100模型在WIDER FACE hard集上实现超过90%的平均精度,同时在移动设备与嵌入式设备上实现实时推理。
- 在八种上下文模块架构之间未发现显著性能差异,表明随机初始化的影响可能大于架构设计本身。
- 更大的主干网络(如ResNet152)在AFLW数据集上的关键点mAE(0.87 ± 0.67 × 10⁻²)低于更小的模型,表明模型大小与关键点准确率之间存在强相关性。
- 最小的模型(MobileNetV2-25)在AFW数据集上达到1.06 ± 1.11 × 10⁻² mAE,在AFLW数据集上达到1.80 ± 2.39 × 10⁻² mAE,优于MTCNN在AFLW上的表现(3.64 ± 2.23 × 10⁻²)。
- 在VGA输入下,该模型比EXTD快34–41 ms,比RefineFace在较慢GPU上快6 ms,同时保持或超越其准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。