Skip to main content
QUICK REVIEW

[论文解读] Deep Deformation Network for Object Landmark Localization

Xiang Yu, Feng Zhou|arXiv (Cornell University)|May 3, 2016
Face recognition and analysis被引用 9
一句话总结

本文提出深度形变网络(DDN),一种用于非刚性物体关键点定位的两阶段级联CNN框架,通过形状基网络(SBN)整合几何约束以实现全局初始化,并通过点变换网络(PTN)实现局部薄板样条形变。该方法在端到端训练下无需手工设计特征或部件连接性假设,实现了面部、人体和鸟类关键点定位任务的最先进性能。

ABSTRACT

We propose a novel cascaded framework, namely deep deformation network (DDN), for localizing landmarks in non-rigid objects. The hallmarks of DDN are its incorporation of geometric constraints within a convolutional neural network (CNN) framework, ease and efficiency of training, as well as generality of application. A novel shape basis network (SBN) forms the first stage of the cascade, whereby landmarks are initialized by combining the benefits of CNN features and a learned shape basis to reduce the complexity of the highly nonlinear pose manifold. In the second stage, a point transformer network (PTN) estimates local deformation parameterized as thin-plate spline transformation for a finer refinement. Our framework does not incorporate either handcrafted features or part connectivity, which enables an end-to-end shape prediction pipeline during both training and testing. In contrast to prior cascaded networks for landmark localization that learn a mapping from feature space to landmark locations, we demonstrate that the regularization induced through geometric priors in the DDN makes it easier to train, yet produces superior results. The efficacy and generality of the architecture is demonstrated through state-of-the-art performances on several benchmarks for multiple tasks such as facial landmark localization, human body pose estimation and bird part localization.

研究动机与目标

  • 解决在多样化物体类别中非刚性形变、外观变化和遮挡带来的关键点定位挑战。
  • 克服先前级联CNN方法依赖复杂初始化、多个子网络或手工设计特征的局限性。
  • 提出一种可泛化的框架,将几何先验直接嵌入CNN架构,以提升正则化效果和精度。
  • 实现端到端训练与推理,无需依赖部件连接性模型或预定义图结构。
  • 在多个基准上展示优越性能:面部关键点、人体姿态估计和鸟类部件定位。

提出的方法

  • 提出两阶段级联架构:首先,通过形状基网络(SBN)将CNN特征投影到低秩形状流形上,生成全局关键点初始化。
  • 利用学习到的形状基对姿态空间进行正则化,降低复杂度并提升非刚性形状的泛化能力。
  • 在第二阶段使用点变换网络(PTN)通过初始关键点预测局部形变,采用薄板样条(TPS)变换。
  • 通过SBN和PTN直接将几何先验融入网络,避免依赖外部图模型或手工设计的部件连接。
  • 通过反向传播同时优化SBN和PTN,实现端到端训练,联合学习形状基与形变参数。
  • 以基于VGG的CNN特征作为输入,直接回归稀疏关键点坐标,无需中间密集监督。

实验结果

研究问题

  • RQ1能否在CNN框架中有效嵌入几何约束,以在无需手工特征的情况下提升关键点定位性能?
  • RQ2将低秩形状基作为先验是否能改善非刚性关键点定位中的初始化与泛化能力?
  • RQ3通过薄板样条建模的局部非刚性形变是否在准确性和鲁棒性上优于直接从CNN特征回归?
  • RQ4所提框架是否能在具有显著外观与形状差异的多样化物体类别(如人脸、人体、鸟类)中实现良好泛化?
  • RQ5具有几何归纳偏差的端到端可训练架构是否能超越需要复杂初始化或多个子网络的先前级联方法?

主要发现

  • DDN在300W人脸关键点数据集上达到最先进性能,PCK@0.10得分为94.0%,超过先前方法(如[60]的93.8%)。
  • 在人体姿态估计的LSP数据集上,DDN取得PCK@0.10得分为88.3%,优于该基准上的先前最先进结果。
  • 在CUB200-2011鸟类部件定位数据集上,DDN取得PCK@0.10得分为93.3%,超过基线方法[60]在相同阈值下的93.4%。
  • 该方法对遮挡和大形变具有鲁棒性,定性结果表明在困难姿态下仍能实现准确的关键点定位。
  • 与全卷积基线相比,DDN通过直接回归稀疏关键点而非预测密集掩码,显著降低了计算成本。
  • 消融实验表明,通过SBN和TPS形变实现的几何正则化,相比直接回归或图模型方法,收敛更快且泛化能力更强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。