[论文解读] Robust Face Detection via Learning Small Faces on Hard Images
本文提出了一种鲁棒的人脸检测器,通过聚焦于困难图像的训练并仅通过单特征图、基于锚点的网络学习小人脸,从而提升对小尺寸、难以检测的人脸的检测性能。该方法在 WIDER FACE 的易、中、难子集上分别实现了 95.7、94.9 和 89.7 的最先进平均精度(APs),且推理速度更快、内存占用更低,优于先前模型。
Recent anchor-based deep face detectors have achieved promising performance, but they are still struggling to detect hard faces, such as small, blurred and partially occluded faces. A reason is that they treat all images and faces equally, without putting more effort on hard ones; however, many training images only contain easy faces, which are less helpful to achieve better performance on hard images. In this paper, we propose that the robustness of a face detector against hard faces can be improved by learning small faces on hard images. Our intuitions are (1) hard images are the images which contain at least one hard face, thus they facilitate training robust face detectors; (2) most hard faces are small faces and other types of hard faces can be easily converted to small faces by shrinking. We build an anchor-based deep face detector, which only output a single feature map with small anchors, to specifically learn small faces and train it by a novel hard image mining strategy. Extensive experiments have been conducted on WIDER FACE, FDDB, Pascal Faces, and AFW datasets to show the effectiveness of our method. Our method achieves APs of 95.7, 94.9 and 89.7 on easy, medium and hard WIDER FACE val dataset respectively, which surpass the previous state-of-the-arts, especially on the hard subset. Code and model are available at https://github.com/bairdzhang/smallhardface.
研究动机与目标
- 解决在真实场景中检测小尺寸、模糊及遮挡人脸的长期挑战。
- 克服现有基于锚点的检测器在困难图像上表现不佳的问题,因其在训练数据中过度拟合于易样本和高质量人脸。
- 通过重新加权训练以优先关注困难图像和小人脸,而非实现对所有尺寸的尺度不变检测,从而提升检测器的鲁棒性。
- 设计一种轻量化、单特征图的检测器,仅专注于小人脸,以提升小样本困难情况下的学习效率和性能。
- 在保持快速推理和低内存消耗的前提下,实现在多个基准测试上的最先进性能。
提出的方法
- 提出一种动态困难图像挖掘策略,基于检测性能为训练图像分配难度分数,从而在每个训练周期前重新采样困难图像。
- 设计一种单阶段、基于锚点的人脸检测器,仅使用一个检测特征图,采用小锚点(如 4×4 到 16×16)以专注检测小人脸,忽略大尺寸人脸。
- 实施多尺度测试策略,引入极小尺度(短边为 100 和 300 像素),在不显著增加计算成本的前提下,保持对易样本和大尺寸人脸的高精度。
- 从 VGG16 的 conv4_3 和 conv5_3 层融合特征,经降维和双线性上采样后生成高分辨率检测特征图。
- 在推理阶段引入水平翻转增强,以在极小速度损失下进一步提升对困难人脸的检测性能。
- 采用类似课程学习的训练策略,强调困难图像和小人脸,避免对尺度变化的过拟合。
实验结果
研究问题
- RQ1将训练重点放在困难图像(定义为包含至少一个困难人脸的图像)上,是否能提升检测器对小尺寸、模糊或遮挡人脸的鲁棒性?
- RQ2通过单特征图设计仅学习小人脸的检测器,是否在检测困难人脸方面优于多尺度、尺度不变的检测器?
- RQ3在多尺度测试中引入极小尺度(如 100 和 300 像素)在多大程度上提升了对易样本和大尺寸人脸的检测精度,而不会增加推理时间?
- RQ4一个简单轻量的检测器架构是否能在标准基准上实现最先进性能,同时相比复杂模型使用更少的 GPU 内存和更快的推理速度?
- RQ5动态困难图像挖掘在不增加额外参数或计算量的前提下,是否能有效重加权训练数据,从而提升对困难样本的检测性能?
主要发现
- 所提出的检测器在 WIDER FACE 验证集上实现了最先进性能,易、中、难子集的 APs 分别为 95.7、94.9 和 89.7,尤其在难子集上显著优于先前最先进方法。
- 在多尺度测试中引入极小尺度(100 和 300 像素)至关重要:若移除这些尺度,易子集 AP 从 95.7 降至 78.2,表明其在检测易样本中的关键作用。
- 该模型在 WIDER FACE 难子集上实现 89.7 的 AP,且在 Titan X 上每张图像仅需 0.84 秒推理时间,推理速度和内存效率均优于 SSH、S3FD 和 PyramidBox。
- 该模型仅使用 5.3 GB GPU 内存,仅为 PyramidBox(11.9 GB)的一半,同时性能更优,证明其具有卓越的内存效率。
- 从推理中移除额外的小尺度(100 和 300 像素)仅使推理时间增加 6.5%(1.59s vs. 1.70s),尽管对小人脸检测精度极高,但开销可忽略不计。
- 该方法泛化能力良好:尽管仅在小人脸上进行训练,但通过多尺度测试,其在大尺寸人脸上的表现依然稳健,证实了单特征图设计的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。