Skip to main content
QUICK REVIEW

[论文解读] MaskFace: multi-task face and landmark detector

D. A. Yashunin, Tamir Baydasov|arXiv (Cornell University)|May 19, 2020
Face recognition and analysis参考文献 60被引用 13
一句话总结

MaskFace 提出了一种多任务人脸与关键点检测模型,将受 Mask R-CNN 启发的关键点头集成到人脸检测框架中,利用 RoIAlign 实现精确的特征提取。通过以极低的计算开销联合预测人脸与关键点,该模型在 WIDER FACE、AFLW 和 300W 数据集上实现了最先进(SOTA)的准确率,优于单任务和多任务模型。

ABSTRACT

Currently in the domain of facial analysis single task approaches for face detection and landmark localization dominate. In this paper we draw attention to multi-task models solving both tasks simultaneously. We present a highly accurate model for face and landmark detection. The method, called MaskFace, extends previous face detection approaches by adding a keypoint prediction head. The new keypoint head adopts ideas of Mask R-CNN by extracting facial features with a RoIAlign layer. The keypoint head adds small computational overhead in the case of few faces in the image while improving the accuracy dramatically. We evaluate MaskFace's performance on a face detection task on the AFW, PASCAL face, FDDB, WIDER FACE datasets and a landmark localization task on the AFLW, 300W datasets. For both tasks MaskFace achieves state-of-the-art results outperforming many of single-task and multi-task models.

研究动机与目标

  • 解决顺序执行的单任务人脸检测与关键点定位流水线所存在的误差传播与缺乏特征共享的问题。
  • 通过联合训练共享表示的统一模型,提升人脸检测与关键点定位的准确性。
  • 探索基于 Mask R-CNN 风格的关键点头在面部关键点预测中的有效性,尤其针对稀疏与密集关键点。
  • 评估模型架构组件(如上下文模块、特征金字塔和主干网络选择)对检测与定位性能的影响。
  • 证明经过精心设计的多任务模型可在无需额外数据增强或监督的情况下,超越更复杂的单任务或多任务基线模型。

提出的方法

  • 在 RetinaFace 和 SSH 风格的人脸检测器基础上,增加一个受 Mask R-CNN 启发的关键点预测头。
  • 使用 RoIAlign 从预测的边界框中提取对齐特征,确保特征与关键点之间的像素级对应关系。
  • 采用特征金字塔网络(FPN)通过融合多尺度特征来增强对小人脸的检测能力。
  • 引入上下文模块以扩大感受野,并改善浅层特征的表示能力。
  • 应用焦点损失(focal loss)与在线难例挖掘(OHEM)以处理基于锚点的人脸检测中的类别不平衡问题。
  • 采用基于回归的关关键点头,使用 L1/L2 损失进行关键点定位,并与检测头端到端联合训练。

实验结果

研究问题

  • RQ1能否有效适配基于 Mask R-CNN 的掩码头用于面部关键点检测,以提升定位准确率?
  • RQ2通过共享特征联合训练人脸检测与关键点定位,是否能优于单任务模型?
  • RQ3关键点头的引入如何影响人脸检测准确率?能否缓解任务间的干扰?
  • RQ4主干网络架构、上下文模块与特征金字塔对检测与关键点定位性能有何影响?
  • RQ5MaskFace 在准确率与推理速度方面相较于最先进单任务与多任务模型表现如何?

主要发现

  • 在使用 ResNeXt-152 的 WIDER FACE 硬样本子集上,MaskFace 实现了 0.9724 的最先进平均精度(AP),优于先前模型。
  • 在 AFLW 数据集上,MaskFace 在 5 个面部关键点上的 CED@0.95 达到 3.39,是无需额外数据或监督方法中的最佳结果。
  • 模型保持了高效率,在 640x480 图像上使用 ResNet-50 时达到约 20 FPS,单张人脸的关键点预测耗时约 11 ms。
  • 消融实验表明,上下文模块与关键点头显著提升了对困难样本(极小或遮挡人脸)的检测能力。
  • 关键点头引入的计算开销可忽略不计——每张人脸仅增加 0.11 ms,适用于实时应用。
  • ResNeXt-152 主干网络取得最佳性能(AP: 0.9724,CED: 3.39),证实更强的特征表示可显著提升准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。