Skip to main content
QUICK REVIEW

[论文解读] Shape Preserving Facial Landmarks with Graph Attention Networks

Andrés Prados-Torreblanca, José M. Buenaposada|arXiv (Cornell University)|Oct 13, 2022
Face recognition and analysis被引用 6
一句话总结

该论文提出SPIGA,一种新型的面部关键点检测模型,结合CNN主干网络与级联图注意力网络(GATs),以学习局部外观特征和全局几何关系。通过整合位置编码、注意力机制以及端到端的粗到细优化策略,SPIGA在遮挡、模糊和极端光照等挑战性条件下实现了最先进性能。

ABSTRACT

Top-performing landmark estimation algorithms are based on exploiting the excellent ability of large convolutional neural networks (CNNs) to represent local appearance. However, it is well known that they can only learn weak spatial relationships. To address this problem, we propose a model based on the combination of a CNN with a cascade of Graph Attention Network regressors. To this end, we introduce an encoding that jointly represents the appearance and location of facial landmarks and an attention mechanism to weigh the information according to its reliability. This is combined with a multi-task approach to initialize the location of graph nodes and a coarse-to-fine landmark description scheme. Our experiments confirm that the proposed model learns a global representation of the structure of the face, achieving top performance in popular benchmarks on head pose and landmark estimation. The improvement provided by our model is most significant in situations involving large changes in the local appearance of landmarks.

研究动机与目标

  • 解决CNN在建模面部关键点之间长程空间关系方面的局限性。
  • 提升在遮挡、模糊、浓妆及极端光照等挑战性场景下的鲁棒性。
  • 在保持高精度关键点定位的同时,学习全局且形状保持的面部几何表征。
  • 通过多任务学习与结构化初始化,实现端到端训练并提升收敛性。
  • 在基准数据集上超越现有方法,尤其在涉及外观模糊性的困难样本子集上表现更优。

提出的方法

  • 采用多阶段热力图回归的CNN主干网络,以生成高质量的局部外观表征。
  • 引入一种联合表示关键点外观与空间位置的位置编码,以提升GAT的输入质量。
  • 利用具有可学习注意力机制的图注意力网络(GATs),建模关键点之间的长程几何依赖关系。
  • 实施粗到细的特征提取策略,使注意力在回归阶段由远距离关键点逐步转向邻近关键点。
  • 通过多任务头进行头姿态估计,以提供关键点位置的准确初始化。
  • 采用级联回归框架,其中每个GAT步骤通过图结构上的上下文感知注意力机制,逐步优化关键点位置。

实验结果

研究问题

  • RQ1与标准CNN相比,基于GAT的回归器结合位置编码与注意力机制,是否能显著提升面部关键点检测中的全局几何建模能力?
  • RQ2粗到细注意力机制在局部外观模糊或退化的情况下,对性能有何影响?
  • RQ3与头姿态估计结合的多任务学习,在关键点初始化与整体收敛性方面,提升程度如何?
  • RQ4各架构组件(如位置编码、注意力机制、级联深度)对最终性能的贡献分别是什么?
  • RQ5与先前最先进方法相比,该模型在遮挡、模糊与浓妆等困难情况下的泛化能力是否更优?

主要发现

  • SPIGA在WFLW、COFW-68与MERL-RAV数据集上均达到最先进性能,WFLW测试集的NME为4.06。
  • 模型在WFLW上的NPE90降低至6.76,表明在挑战性条件下具有更强鲁棒性。
  • 位置编码对性能贡献最大,在困难子集上相比无位置编码模型,NME最高降低0.32点。
  • 粗到细注意力机制在遮挡与模糊情况下优于固定感受野大小(如w=8或w=1)的设置。
  • 第一层GAT关注远距离、可靠的地标,而后续层则聚焦于邻近地标,表明实现了有效的全局到局部优化。
  • 三阶段级联结构在精度与鲁棒性之间达到最佳平衡,FR10从2.60降至2.08,表明异常值拒绝能力显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。