Skip to main content
QUICK REVIEW

[论文解读] End-to-end training of object class detectors for mean average precision

Paul Henderson, Vittorio Ferrari|arXiv (Cornell University)|Jul 12, 2016
Domain Adaptation and Few-Shot Learning参考文献 24被引用 11
一句话总结

该论文提出通过在训练过程中引入非极大值抑制(NMS),使用平均平均精度(mAP)作为损失函数,实现基于卷积神经网络(CNN)的目标检测器的端到端训练。该方法为分段常数函数引入了新型伪梯度估计器,使通过mAP与NMS进行反向传播成为可能,在性能上达到与标准Fast R-CNN相当的水平,同时确保训练与推理阶段的目标完全一致。

ABSTRACT

We present a method for training CNN-based object class detectors directly using mean average precision (mAP) as the training loss, in a truly end-to-end fashion that includes non-maximum suppression (NMS) at training time. This contrasts with the traditional approach of training a CNN for a window classification loss, then applying NMS only at test time, when mAP is used as the evaluation metric in place of classification accuracy. However, mAP following NMS forms a piecewise-constant structured loss over thousands of windows, with gradients that do not convey useful information for gradient descent. Hence, we define new, general gradient-like quantities for piecewise constant functions, which have wide applicability. We describe how to calculate these efficiently for mAP following NMS, enabling to train a detector based on Fast R-CNN directly for mAP. This model achieves equivalent performance to the standard Fast R-CNN on the PASCAL VOC 2007 and 2012 datasets, while being conceptually more appealing as the very same model and loss are used at both training and test time.

研究动机与目标

  • 解决训练时使用窗口分类准确率而推理时使用mAP评估之间的不一致问题。
  • 通过将NMS和mAP作为训练目标,实现目标检测器真正的端到端训练。
  • 通过定义新的类似梯度的量,克服在NMS后优化非可微、分段常数mAP的挑战。
  • 开发一种与标准深度学习框架兼容的方法,无需昂贵的max-oracle计算。

提出的方法

  • 提出两种针对分段常数函数的伪梯度估计器——MEE(期望编辑均值)和SDE(得分差估计器),用于近似NMS后mAP的梯度。
  • 引入一个可微的mAP损失层,用于在NMS后检测结果上计算mAP,从而实现整个检测流程的反向传播。
  • 将该方法应用于Fast R-CNN框架,在整个检测器上使用随机梯度下降进行端到端训练,以mAP作为损失函数。
  • 在训练中使用NMS,确保模型学习优化最终评估指标,包括抑制带来的非局部效应。
  • 采用得分正则化和梯度裁剪以稳定训练,因为原始mAP梯度稀疏且方差高。
  • 设计该方法为即插即用形式,可直接集成到Caffe等现有深度学习框架中,无需修改优化算法。

实验结果

研究问题

  • RQ1是否可以在训练过程中包含NMS,直接以mAP为目标进行目标检测器的端到端训练,而非仅在推理时应用?
  • RQ2在标准反向传播失效的情况下,如何为NMS后分段常数mAP损失近似梯度?
  • RQ3在训练中引入NMS的mAP端到端训练是否能获得与标准窗口分类准确率训练相当的性能?
  • RQ4所提出的伪梯度估计器是否可推广至其他分段常数损失(如信息检索中使用的损失)?
  • RQ5该方法在实际中是否稳定且可扩展,是否避免了昂贵的max-oracle计算?

主要发现

  • 在PASCAL VOC 2007和2012数据集上,使用mAP和NMS进行训练时,所提方法在mAP性能上与标准Fast R-CNN相当。
  • 在所有实验中,MEE伪梯度估计器表现略优于SDE,尤其因其对得分距离变化具有更强的鲁棒性。
  • VGG16模型的表现优于AlexNet模型,证实了在mAP训练中使用更深架构的优势。
  • 消融实验表明,关键的训练改进措施(如前景采样比例、批量大小、得分正则化和梯度裁剪)对训练稳定性至关重要。
  • 若缺少梯度裁剪或得分正则化,训练将失败,因为梯度会变得数值不稳定并引发得分爆炸。
  • 与Song等[19]的先前工作相比,该方法在训练稳定性和通用性方面表现更优,同时避免了对类别特定模型或max-oracle计算的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。