Skip to main content
QUICK REVIEW

[论文解读] FacePoseNet: Making a Case for Landmark-Free Face Alignment

Feng-Ju Chang, Anh Tran|arXiv (Cornell University)|Aug 24, 2017
Face recognition and analysis参考文献 46被引用 16
一句话总结

FacePoseNet (FPN) 提出了一种无需关键点的面部对齐方法,通过轻量级卷积神经网络(CNN)直接从图像强度回归6自由度(6DoF)三维头部姿态,在IJB-A和IJB-B基准测试中实现了更优的面部识别准确率,且速度比当前最先进的关键点检测器快一个数量级,挑战了‘更高关键点检测准确率能提升下游识别性能’的假设。

ABSTRACT

We show how a simple convolutional neural network (CNN) can be trained to accurately and robustly regress 6 degrees of freedom (6DoF) 3D head pose, directly from image intensities. We further explain how this FacePoseNet (FPN) can be used to align faces in 2D and 3D as an alternative to explicit facial landmark detection for these tasks. We claim that in many cases the standard means of measuring landmark detector accuracy can be misleading when comparing different face alignments. Instead, we compare our FPN with existing methods by evaluating how they affect face recognition accuracy on the IJB-A and IJB-B benchmarks: using the same recognition pipeline, but varying the face alignment method. Our results show that (a) better landmark detection accuracy measured on the 300W benchmark does not necessarily imply better face recognition accuracy. (b) Our FPN provides superior 2D and 3D face alignment on both benchmarks. Finally, (c), FPN aligns faces at a small fraction of the computational cost of comparably accurate landmark detectors. For many purposes, FPN is thus a far faster and far more accurate face alignment method than using facial landmark detectors.

研究动机与目标

  • 挑战‘在300W等基准上更高的面部关键点检测准确率能带来更好面部对齐与识别性能’的假设。
  • 提出一种无需关键点检测的面部对齐方法,绕过显式的关键点检测,直接从图像强度回归6DoF头部姿态。
  • 不以关键点检测准确率为评价标准,而是通过其对端到端面部识别性能的影响来评估面部对齐方法。
  • 证明FPN在显著更低的计算成本下,实现了更优的2D与3D面部对齐效果,优于同类关键点检测器。
  • 表明关键点检测的噪声以及面部表情的可变性会降低对齐质量,因此在许多情况下,无关键点的姿态回归是更鲁棒的替代方案。

提出的方法

  • 训练一个简单且轻量的卷积神经网络(CNN),直接从原始图像强度回归6个自由度(6DoF)的3D头部姿态。
  • 网络使用由OpenFace生成的姿态标注进行训练,包含旋转和位移参数,实现无需显式关键点监督的端到端回归。
  • 通过基于预测的6DoF姿态应用3D变换,将输入人脸映射到规范参考坐标系,完成面部对齐。
  • 该方法避免依赖面部关键点,从而消除了因面部表情、形状差异以及关键点定义模糊性带来的误差。
  • 通过GPU部署加速模型推理,实现比当前最先进的关键点检测器快约10倍的实时对齐速度。
  • 在IJB-A和IJB-B基准上采用统一的面部识别流程评估该方法,对齐质量通过识别准确率衡量。

实验结果

研究问题

  • RQ1在300W等标准基准上更高的关键点检测准确率是否与更好的面部识别性能相关?
  • RQ2能否通过直接从图像强度回归6DoF三维姿态,实现优于基于关键点的对齐方法的面部识别性能?
  • RQ3面部表情与形状的可变性如何影响基于关键点的面部对齐的可靠性?
  • RQ4在实际应用中,无关键点姿态回归的计算成本与关键点检测相比如何?
  • RQ5在噪声或不完美的姿态标签上进行训练的CNN,是否仍能对具有挑战性的非约束面部图像泛化良好?

主要发现

  • 尽管在300W基准上的关键点检测准确率低于当前最先进的关键点检测器,FacePoseNet在IJB-A和IJB-B基准上仍实现了更优的面部识别准确率。
  • 该方法的速度约为同类关键点检测方法的10倍,平均推理时间显著低于所有其他测试方法。
  • 尽管FPN在300W上的关键点预测准确率低于OpenFace及其他检测器,但其生成的面部对齐反而带来了更好的识别性能。
  • 本研究证明,在标准基准上提升关键点检测准确率并不一定带来更好的对齐或识别结果。
  • 由于绕过了关键点估计,FPN对表情和形状变化具有鲁棒性,减少了对齐过程中的误差传播。
  • 结果表明,CNN能够有效从噪声或不完美的姿态标签中学习,并在域偏移(如从约束到非约束面部图像)下表现出良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。