Skip to main content
QUICK REVIEW

[论文解读] Adaloss: Adaptive Loss Function for Landmark Localization

Brian Teixeira, Birgi Tamersoy|arXiv (Cornell University)|Aug 2, 2019
Face recognition and analysis参考文献 31被引用 7
一句话总结

Adaloss 是一种新颖的、与应用无关的自适应损失函数,能够在训练过程中动态调整目标热图的方差,以平衡样本偏差与定位精度。通过根据训练统计信息逐步降低目标方差,它实现了深度网络在关键点定位任务中的稳定端到端训练,在医学X光片、内窥镜图像以及真实场景下的人脸图像任务中均取得了最先进性能。

ABSTRACT

Landmark localization is a challenging problem in computer vision with a multitude of applications. Recent deep learning based methods have shown improved results by regressing likelihood maps instead of regressing the coordinates directly. However, setting the precision of these regression targets during the training is a cumbersome process since it creates a trade-off between trainability vs localization accuracy. Using precise targets introduces a significant sampling bias and hence makes the training more difficult, whereas using imprecise targets results in inaccurate landmark detectors. In this paper, we introduce "Adaloss", an objective function that adapts itself during the training by updating the target precision based on the training statistics. This approach does not require setting problem-specific parameters and shows improved stability in training and better localization accuracy during inference. We demonstrate the effectiveness of our proposed method in three different applications of landmark localization: 1) the challenging task of precisely detecting catheter tips in medical X-ray images, 2) localizing surgical instruments in endoscopic images, and 3) localizing facial features on in-the-wild images where we show state-of-the-art results on the 300-W benchmark dataset.

研究动机与目标

  • 为解决使用稀疏、高精度热图进行深度网络训练时导致的样本偏差和收敛性差的问题。
  • 消除在损失函数中手动调整热图方差这一与应用相关的超参数调优需求。
  • 通过自适应损失调度隐式构建课程学习机制,提升训练稳定性和推理精度。
  • 在无需对网络架构或超参数进行大幅修改的前提下,实现跨多种领域关键点检测器的鲁棒端到端训练。
  • 在包括 300-W、EndoVis 和 X 射线导管尖端检测在内的关键点定位基准测试中达到最先进性能。

提出的方法

  • Adaloss 根据关键点特定的训练统计信息,在训练过程中动态调整高斯目标热图的方差。
  • 训练初期使用高方差热图以减少样本偏差,并随着训练进程逐步降低方差。
  • 通过隐式增加问题难度随时间推移的课程学习策略,提升网络稳定性。
  • 可无缝集成到现有训练流程中,无需修改网络架构或优化超参数。
  • 自适应方差更新通过每类关键点的预测误差移动平均值计算得出。
  • 后处理包括中值滤波和非极大值抑制,以处理多实例情况并聚合同类峰值位置。

实验结果

研究问题

  • RQ1自适应损失函数是否能提升在高度稀疏目标热图下的关键点定位训练稳定性和收敛性?
  • RQ2在训练过程中动态调整热图方差是否能降低对初始学习率和超参数调优的敏感性?
  • RQ3一个单一的、与应用无关的损失函数是否能在多种关键点定位任务中实现最先进性能?
  • RQ4该自适应损失在具有高标注不确定性的数据集或稀疏标注数据集上的表现如何?
  • RQ5在推理阶段,该方法在未见过的工具类型或关键点配置下具有多大程度的泛化能力?

主要发现

  • 在真实场景人脸关键点定位的 300-W 基准测试中,Adaloss 达到了最先进性能,优于以往方法。
  • 在 X 射线图像中的导管尖端检测任务中,Adaloss 仅需极少超参数调优即实现了高精度和高准确性,适用于临床应用。
  • 在 EndoVis 数据集上,Adaloss 对针持器上的左夹持器检测实现了 95.56% 的召回率和 90.50% 的精确率,优于多阶段基线方法的 86.65% 精确率和 86.28% 召回率。
  • 在同时包含针持器和弯曲剪刀(未在训练中出现)的图像上测试时,Adaloss 保持了 92.16% 的平均精确率,展现出强大的泛化能力和区分能力。
  • 该方法降低了训练不稳定性并缩短了收敛时间,即使在使用较高初始学习率时也表现出更强的鲁棒性。
  • Adaloss 在完整的 EndoVis 测试集上实现了 6.83 像素的平均欧氏距离,表明其在复杂场景中具有极高的定位精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。