Skip to main content
QUICK REVIEW

[论文解读] Coarse-to-fine Face Alignment with Multi-Scale Local Patch Regression

Zhiao Huang, Erjin Zhou|arXiv (Cornell University)|Nov 16, 2015
Face recognition and analysis参考文献 1被引用 14
一句话总结

本文提出一种基于多尺度局部块回归的粗到细人脸对齐方法,其中初始全局深度网络预测关键点,随后通过多尺度局部块迭代优化以提高精度。该方法在300-W数据集上达到最先进性能,全测试集的平均误差降低至4.54个归一化像素。

ABSTRACT

Facial landmark localization plays an important role in face recognition and analysis applications. In this paper, we give a brief introduction to a coarse-to-fine pipeline with neural networks and sequential regression. First, a global convolutional network is applied to the holistic facial image to give an initial landmark prediction. A pyramid of multi-scale local image patches is then cropped to feed to a new network for each landmark to refine the prediction. As the refinement network outputs a more accurate position estimation than the input, such procedure could be repeated several times until the estimation converges. We evaluate our system on the 300-W dataset [11] and it outperforms the recent state-of-the-arts.

研究动机与目标

  • 在存在大姿态、光照和表情变化的野外条件下,提升人脸关键点定位的性能。
  • 开发一种端到端的粗到细框架,通过顺序优化提升关键点预测精度。
  • 利用多尺度局部图像块,实现每个关键点的精确、局部回归。
  • 在300-W基准数据集上超越现有最先进方法。

提出的方法

  • 一个全局卷积神经网络处理整张人脸图像,生成初始关键点估计。
  • 通过估计的尺度和图像平面内的旋转对人脸进行几何归一化,以消除姿态差异。
  • 一系列优化网络处理以每个关键点为中心的多尺度局部图像块,以改进位置估计。
  • 每个优化网络接收多尺度块的金字塔作为输入,并输出更精确的关键点位置。
  • 优化过程迭代执行直至收敛,最终预测结果在多个网络之间取平均。
  • 通过线性最小二乘回归将MFLD数据集的81个关键点映射到300-W标准的68个关键点,用于评估。

实验结果

研究问题

  • RQ1基于多尺度局部块回归的粗到细回归流程是否能提升野外人脸图像的关键点定位精度?
  • RQ2与单阶段回归相比,使用局部块进行迭代优化在降低定位误差方面的效果如何?
  • RQ3使用多尺度块是否能增强对姿态、光照和表情变化的鲁棒性?
  • RQ4所提出方法在300-W基准上的表现相较于现有最先进方法有多大优势?

主要发现

  • 粗到细流程显著提升了关键点定位精度,在MFLD测试集上,归一化平均误差从5.93降低至4.15。
  • 优化过程在每个阶段均提升性能,误差从初始的5.93降至三次优化步骤后的4.15。
  • 在300-W数据集上,该方法在全测试集上实现了4.54的归一化平均误差,优于所有先前的最先进方法。
  • 即使在最具挑战性的iBUG子集上,系统仍保持高精度,平均误差为7.46个归一化像素。
  • 结果表明,多尺度局部块回归能够在大变化条件下实现鲁棒且精确的关键点优化。
  • 优化网络的递归应用实现了收敛,并带来了稳定且一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。