Skip to main content
QUICK REVIEW

[论文解读] Classification Calibration for Long-tail Instance Segmentation

Tao Wang, Yu Li|arXiv (Cornell University)|Oct 29, 2019
Advanced Neural Network Applications参考文献 9被引用 9
一句话总结

本文提出一种分类校准方法,通过使用类别平衡采样重新训练分类头,在长尾数据集(如LVIS)上显著提升实例分割性能,无需修改模型架构,大幅改善了罕见类别的识别能力。该方法在使用真实框建议标签时,将(0,10)尾部类别区间mAP从0.0提升至39.7,并在集成与多尺度测试下于LVIS测试集上达到37.05 AP,展现出在罕见类别上的显著性能提升。

ABSTRACT

Remarkable progress has been made in object instance detection and segmentation in recent years. However, existing state-of-the-art methods are mostly evaluated with fairly balanced and class-limited benchmarks, such as Microsoft COCO dataset [8]. In this report, we investigate the performance drop phenomenon of state-of-the-art two-stage instance segmentation models when processing extreme long-tail training data based on the LVIS [5] dataset, and find a major cause is the inaccurate classification of object proposals. Based on this observation, we propose to calibrate the prediction of classification head to improve recognition performance for the tail classes. Without much additional cost and modification of the detection model architecture, our calibration method improves the performance of the baseline by a large margin on the tail classes. Codes will be available. Importantly, after the submission, we find significant improvement can be further achieved by modifying the calibration head, which we will update later.

研究动机与目标

  • 解决当前最先进两阶段实例分割模型在长尾数据集(如LVIS)上的性能下降问题。
  • 识别并缓解罕见类别识别能力差的根本原因,特别是建议框分类不准确的问题。
  • 在不修改检测模型架构的前提下,提升对罕见类别(例如训练样本少于10个)的识别能力。
  • 开发一种轻量化、高效的校准方法,以提升长尾数据下建议框分类的准确性。
  • 在罕见类别和长尾类别上超越现有图像级重复采样基线方法,同时保持对常见类别的性能表现。

提出的方法

  • 使用类别平衡采样重新训练分类头:每批次采样16个类别,每个类别一张图像,以改善对罕见类别的学习。
  • 将原始分类头与重新训练分类头的预测结果相结合,以校准最终预测结果,且不改变模型架构。
  • 在评估过程中使用真实框类别标签来验证性能差的根本原因是否为分类错误,而非建议框生成问题。
  • 将该校准方法应用于Mask R-CNN和更复杂的Hybrid Task Cascade(HTC)模型,以验证其泛化能力。
  • 利用外部数据(COCO和COCO-Stuff)进行预训练和语义头监督,以提升整体性能。
  • 采用集成与多尺度测试策略,进一步提升在LVIS测试集上的最终性能。

实验结果

研究问题

  • RQ1为何最先进实例分割模型在长尾数据集(如LVIS)上表现不佳?
  • RQ2性能下降的主要原因是否源于建议框分类不佳,还是建议框生成质量差?
  • RQ3使用平衡采样重新训练分类头是否能显著提升对罕见类别的识别能力?
  • RQ4与图像级重复采样相比,所提出的校准方法在尾部类别上的性能表现如何?
  • RQ5该校准方法能否有效应用于复杂多阶段模型(如HTC)而不会导致常见类别性能下降?

主要发现

  • 基线Mask R-CNN在(0,10)尾部类别区间mAP仅为0.0,表明对罕见物体的识别存在严重失败。
  • 与COCO相比,LVIS上的建议框召回率下降8.8%,AP下降45.1%,证实分类准确性是主要瓶颈。
  • 使用真实标签进行建议框分类可使(0,10)区间mAP提升至39.7,证明核心问题在于分类而非建议框生成。
  • 所提出的校准方法使Mask R-CNN在(0,10)区间的mAP从0.0提升至8.6,HTC模型则提升至12.7,表明在罕见类别上取得显著增益。
  • 通过集成与多尺度测试,最终模型在LVIS测试集上达到39.21 AP,显著优于最佳基线模型的30.0 AP。
  • 该方法在(0,10)区间上优于图像级重复采样,且在多实例类别上性能下降更小,展现出更好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。