Skip to main content
QUICK REVIEW

[论文解读] The Devil is in Classification: A Simple Framework for Long-tail Object Detection and Instance Segmentation

Tao Wang, Yu Li|arXiv (Cornell University)|Jul 23, 2020
Advanced Neural Network Applications参考文献 38被引用 4
一句话总结

本文提出 SimCal,一种简单而有效的校准框架,通过校正两阶段模型(如 Mask R-CNN)中分类头的偏差,解决长尾实例分割问题。通过使用双层类别平衡采样策略,在重新训练分类头时提升低频类别的表示,并结合原始分类头与校准后分类头的预测结果,采用一种新颖的集成策略,SimCal 在 LVIS 和 COCO-LT 上实现了最先进性能,显著提升了尾部类别的 AP,同时保持头部类别的性能不受影响。

ABSTRACT

Most existing object instance detection and segmentation models only work well on fairly balanced benchmarks where per-category training sample numbers are comparable, such as COCO. They tend to suffer performance drop on realistic datasets that are usually long-tailed. This work aims to study and address such open challenges. Specifically, we systematically investigate performance drop of the state-of-the-art two-stage instance segmentation model Mask R-CNN on the recent long-tail LVIS dataset, and unveil that a major cause is the inaccurate classification of object proposals. Based on such an observation, we first consider various techniques for improving long-tail classification performance which indeed enhance instance segmentation results. We then propose a simple calibration framework to more effectively alleviate classification head bias with a bi-level class balanced sampling approach. Without bells and whistles, it significantly boosts the performance of instance segmentation for tail classes on the recent LVIS dataset and our sampled COCO-LT dataset. Our analysis provides useful insights for solving long-tail instance detection and segmentation problems, and the straightforward \emph{SimCal} method can serve as a simple but strong baseline. With the method we have won the 2019 LVIS challenge. Codes and models are available at https://github.com/twangnh/SimCal.

研究动机与目标

  • 探究 SOTA 两阶段实例分割模型(如 Mask R-CNN)在长尾数据集(如 LVIS)上表现不佳的原因。
  • 识别出对象提议分类不准确为尾部类别性能下降的主要原因。
  • 开发一种简单、有效的校准框架,在不重新训练整个模型的前提下提升分类头性能。
  • 在显著提升长尾(尾部)类别性能的同时,保持头部类别的高性能。
  • 为长尾实例分割提供一个强大且实用的基线模型,可轻松集成到现有模型中。

提出的方法

  • 提出一种解耦学习方案:在标准训练后,使用一种结合图像级和实例级采样的双层采样策略,对分类头进行校准,以平衡各类别的分布。
  • 采用一种新的双层采样方法,收集在所有类别中类别分布均衡的提议样本,尤其增强对尾部类别的表示。
  • 仅在平衡的提议集上使用标准交叉熵损失重新训练分类头,最大程度减少对检测头和掩码头的干扰。
  • 引入一种双头推理策略,通过一种新颖的输出组合方法(sel)融合原始分类头与校准后分类头的预测结果,该方法优于平均融合或基于 NMS 的融合。
  • 应用一种缩放与归一化策略(sel-scale, sel-norm),对齐原始分类头与校准后分类头之间的置信度分数,提升检测质量。
  • 在校准过程中使用简单且固定的初始学习率(0.01),与标准训练保持一致,避免繁琐的超参数调优。

实验结果

研究问题

  • RQ1为何 SOTA 两阶段实例分割模型在长尾数据集(如 LVIS)上表现不佳?
  • RQ2由不平衡训练样本引起的分类头偏差,在多大程度上导致了尾部类别性能下降?
  • RQ3能否通过一种简单、后训练的分类头校准方法,在不重新训练整个模型的前提下,显著提升长尾实例分割性能?
  • RQ4如何最优地结合原始分类头与校准后分类头的预测结果,以在所有类别上实现最大性能?
  • RQ5校准带来的性能增益是否依赖于微调分类头的哪几层?

主要发现

  • 长尾数据集上性能下降的主要原因是对象提议分类不准确,而非区域建议网络(RPN)的质量问题。
  • 在使用 ResNet-50-FPN 的 LVIS 数据集上,SimCal 达到 23.4 AP,相比基线 18.0 AP 显著提升,尾部类别 AP_f 提升 5.4 点(从 16.4 提升至 22.5)。
  • 所提出的组合方法(sel)达到 21.1 AP,优于平均融合(20.3 AP)和基于 NMS 的融合(19.8 AP)。
  • 对完整 3 层分类头进行校准可获得最佳性能(22.2 AP),优于仅对最后 2 层或最后 1 层进行部分校准。
  • 校准的最优学习率为 0.01,与标准训练一致,表明无需使用典型微调中常见的低学习率。
  • 尾部类别的性能方差更高(如 AP_f 的方差为 1.3),证实了长尾学习的挑战性,而头部类别因训练数据丰富,方差较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。