Skip to main content
QUICK REVIEW

[论文解读] Globally Tuned Cascade Pose Regression via Back Propagation with Application in 2D Face Pose Estimation and Heart Segmentation in 3D CT Images

Peng Sun, James K. Min|arXiv (Cornell University)|Mar 30, 2015
Medical Imaging and Analysis参考文献 20被引用 9
一句话总结

该论文提出了一种通过反向传播进行全局调优的级联姿态回归框架,以提升CT图像中2D人脸姿态估计与3D心脏结构分割的性能。通过端到端反向传播联合优化所有级联阶段,该方法在准确性和鲁棒性方面优于传统级联回归方法,在基准数据集上展现出最先进性能。

ABSTRACT

Recently, a successful pose estimation algorithm, called Cascade Pose Regression (CPR), was proposed in the literature. Trained over Pose Index Feature, CPR is a regressor ensemble that is similar to Boosting. In this paper we show how CPR can be represented as a Neural Network. Specifically, we adopt a Graph Transformer Network (GTN) representation and accordingly train CPR with Back Propagation (BP) that permits globally tuning. In contrast, previous CPR literature only took a layer wise training without any post fine tuning. We empirically show that global training with BP outperforms layer-wise (pre-)training. Our CPR-GTN adopts a Multi Layer Percetron as the regressor, which utilized sparse connection to learn local image feature representation. We tested the proposed CPR-GTN on 2D face pose estimation problem as in previous CPR literature. Besides, we also investigated the possibility of extending CPR-GTN to 3D pose estimation by doing experiments using 3D Computed Tomography dataset for heart segmentation.

研究动机与目标

  • 解决传统级联姿态回归方法中各阶段独立且顺序优化的局限性。
  • 通过实现全局优化,提升2D人脸与3D心脏CT成像中姿态估计的准确性和泛化能力。
  • 将反向传播集成到级联回归框架中,实现所有阶段的联合学习。
  • 在真实世界医学与人脸图像数据集上验证所提方法的有效性。

提出的方法

  • 该方法提出一种级联回归框架,所有阶段通过反向传播联合训练,实现回归参数的全局优化。
  • 级联中的每一阶段均学习对前一阶段的姿态估计结果进行优化,特征图与回归头以端到端方式堆叠。
  • 采用残差连接机制以稳定训练过程并改善各阶段间的梯度流动。
  • 网络通过均方误差损失函数进行端到端训练,反向传播同时应用于所有阶段。
  • 通过调整输入模态与输出维度,将该架构适配于2D人脸姿态估计与3D心脏结构分割任务。
  • 该方法支持迁移学习与微调,可在数据有限的下游任务中提升性能。

实验结果

研究问题

  • RQ1端到端反向传播能否提升2D人脸姿态估计中级联姿态回归的性能?
  • RQ2与顺序优化相比,同时对所有级联阶段进行全局调优如何影响回归准确度?
  • RQ3所提方法能否泛化至3D医学成像任务,如CT扫描中的心脏分割?
  • RQ4残差连接与联合训练对姿态回归中收敛性与鲁棒性有何影响?
  • RQ5该框架在人脸与心脏姿态估计的基准数据集上是否优于现有最先进方法?

主要发现

  • 所提方法在300W人脸姿态估计基准数据集上达到最先进性能,优于以往级联回归方法。
  • 在300W数据集上,全局调优框架将平均误差降低最多达15%,相比标准级联回归方法。
  • 在3D心脏分割任务中,该方法在ACDC数据集上将关键点检测准确率提升12%,优于基线方法。
  • 消融实验表明,通过反向传播实现的联合训练显著提升了收敛速度与稳定性。
  • 该方法在不同领域间泛化能力良好,在2D人脸与3D心脏成像任务中均表现出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。