Skip to main content
QUICK REVIEW

[论文解读] AnchorFace: An Anchor-based Facial Landmark Detector Across Large Poses

Zixuan Xu, Banghuai Li|arXiv (Cornell University)|Jul 7, 2020
Face recognition and analysis参考文献 43被引用 8
一句话总结

AnchorFace 提出了一种基于锚点的面部关键点检测框架,通过使用针对姿态的锚点模板分割回归搜索空间,并采用置信度加权聚合预测结果,从而在大姿态变化下提升准确率与鲁棒性。该方法在 AFLW、300W、Menpo 和 WFLW 基准测试中实现了最先进性能,推理速度约为 45 FPS。

ABSTRACT

Facial landmark localization aims to detect the predefined points of human faces, and the topic has been rapidly improved with the recent development of neural network based methods. However, it remains a challenging task when dealing with faces in unconstrained scenarios, especially with large pose variations. In this paper, we target the problem of facial landmark localization across large poses and address this task based on a split-and-aggregate strategy. To split the search space, we propose a set of anchor templates as references for regression, which well addresses the large variations of face poses. Based on the prediction of each anchor template, we propose to aggregate the results, which can reduce the landmark uncertainty due to the large poses. Overall, our proposed approach, named AnchorFace, obtains state-of-the-art results with extremely efficient inference speed on four challenging benchmarks, i.e. AFLW, 300W, Menpo, and WFLW dataset. Code will be available at https://github.com/nothingelse92/AnchorFace.

研究动机与目标

  • 为解决在大姿态变化下面部关键点定位的挑战,传统回归方法在此类场景中常因高不确定性与误差而表现不佳。
  • 通过使用预先定义的锚点模板匹配多样化面部姿态,将关键点回归的搜索空间进行划分,从而降低回归复杂度。
  • 通过使用置信度加权投票聚合多个锚点的预测结果,提升对遮挡与噪声标注的鲁棒性。
  • 在保持实际部署所需实时推理速度的同时,实现高准确率,适用于非约束环境下的实际应用。

提出的方法

  • 该方法采用拆分与聚合策略:首先利用通过 K-means 聚类或手工设计的模板生成的一组锚点模板,对搜索空间进行分割,以匹配各种姿态变化。
  • 针对每个锚点模板,网络使用轻量级主干网络(如 ShuffleNet-V2)回归从锚点到真实关键点位置的 2D 偏移量。
  • 额外的置信度分支用于预测每个锚点预测结果的可靠性,从而实现对所有锚点预测结果的置信度加权聚合。
  • 最终的关键点坐标通过所有锚点预测结果的加权平均计算得出,权重为预测的置信度,从而降低来自模糊或遮挡关键点的不确定性。
  • 锚点模板通过在偏航、俯仰和滚转维度上对基础模板进行变换生成,以覆盖训练数据中的大姿态变化。
  • 通过消融实验优化超参数,如锚点区域(56×56)、锚点网格(7×7)和模板数量(24),以在准确率与效率之间取得平衡。

实验结果

研究问题

  • RQ1基于锚点的设计是否能有效降低在大姿态变化下面部关键点定位的回归难度?
  • RQ2置信度加权聚合多个锚点预测结果,如何提升对遮挡与标注噪声的鲁棒性?
  • RQ3锚点模板、锚点区域与锚点网格的最优配置为何?该配置如何在准确率与推理速度之间实现平衡?
  • RQ4所提出的拆分与聚合策略是否在大姿态基准测试中优于直接回归方法与现有最先进方法?

主要发现

  • AnchorFace 在四个大姿态基准测试(AFLW、300W、Menpo 和 WFLW)中实现了最先进性能,平均误差相比基线回归方法降低最多达 10%。
  • 置信度加权聚合策略优于 argmax 与平均聚合方法,在所有基准测试中平均误差降低 0.02–0.16。
  • 通过 K-means 聚类生成的 24 个锚点模板性能优于手工设计模板,表明数据驱动的模板设计更具有效性。
  • 最优锚点区域为图像中心附近的 56×56,7×7 的锚点网格在准确率与计算成本之间提供了最佳权衡。
  • 模型在单张 NVIDIA Titan Xp GPU 上实现了约 45 FPS 的推理速度,证明其具备实时处理能力,适用于实际部署。
  • 消融实验表明,基于锚点的回归在所有姿态类别中均将误差降低 0.1–0.3,尤其在极端偏航与俯仰角度下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。