Skip to main content
QUICK REVIEW

[论文解读] 1st Place Solution of LVIS Challenge 2020: A Good Box is not a Guarantee of a Good Mask

Jingru Tan, Gang Zhang|arXiv (Cornell University)|Sep 3, 2020
Central Venous Catheters and Hemodialysis参考文献 17被引用 13
一句话总结

本论文提出了一种针对长尾LVIS数据集的两阶段训练方法,用于实例分割,同时解决了类别不平衡和高质量掩码预测的问题。该方法提出了一种基于边界框尺度和掩码与边界框面积比的新颖提议分配策略,并引入了一种结合Dice损失与加权交叉熵的平衡掩码损失,最终在LVIS v1.0验证集上达到41.5 AP,在测试开发集上达到41.2 AP,显著优于基线模型。

ABSTRACT

This article introduces the solutions of the team lvisTraveler for LVIS Challenge 2020. In this work, two characteristics of LVIS dataset are mainly considered: the long-tailed distribution and high quality instance segmentation mask. We adopt a two-stage training pipeline. In the first stage, we incorporate EQL and self-training to learn generalized representation. In the second stage, we utilize Balanced GroupSoftmax to promote the classifier, and propose a novel proposal assignment strategy and a new balanced mask loss for mask head to get more precise mask predictions. Finally, we achieve 41.5 and 41.2 AP on LVIS v1.0 val and test-dev splits respectively, outperforming the baseline based on X101-FPN-MaskRCNN by a large margin.

研究动机与目标

  • 解决LVIS数据集中极端长尾的类别分布问题,其中稀有类别标注数量远少于常见类别。
  • 提升实例分割掩码质量,特别是针对其边界框内掩码较薄的类别。
  • 克服边界框与特征图分辨率不匹配导致的局限性,即即使边界框对齐良好,也无法保证精确的掩码预测。
  • 缩小标准检测器在LVIS上掩码AP与边界框AP之间的性能差距。
  • 通过表示学习与针对性头部优化相结合,实现在LVIS v1.0上的最先进性能。

提出的方法

  • 在表示学习阶段应用等化损失(EQL)与重复因子采样(RFS),以缓解类别间不平衡问题。
  • 采用Mosaic、旋转与尺度抖动数据增强,并利用Open Images和LVIS的伪标签进行自训练,以提升表示能力。
  • 提出一种新的提议分配策略,基于边界框尺度与掩码-边界框面积比分配掩码特征,使用公式(1)选择特征图层级。
  • 引入一种平衡掩码损失,结合Dice损失与加权二元交叉熵,其前景权重根据面积比动态调整,如公式(2)所定义。
  • 在微调阶段应用平衡组Softmax,以平衡稀有类别与常见类别之间的分类器权重。
  • 在测试时采用增强策略,包括基于尺度的边界框过滤、稀有类别得分重加权,以及基于边界框尺度与面积比的掩码预测选择。

实验结果

研究问题

  • RQ1利用开放词汇数据集(如Open Images)的伪标签进行自训练,能否提升在标注稀疏的LVIS数据集上的表示学习能力?
  • RQ2在提议分配中考虑掩码与边界框面积比,能否提升对薄掩码实例的掩码质量?
  • RQ3一种能考虑薄掩码中前景-背景像素不平衡的平衡掩码损失,能否提升分割精度?
  • RQ4两阶段训练流程(先表示学习,再头部特定微调)在多大程度上能缩小掩码与边界框AP之间的差距?
  • RQ5结合EQL、RFS、自训练与新型头部组件,在长尾LVIS基准上能否实现最先进性能?

主要发现

  • 所提方法在LVIS v1.0验证集上达到41.5 AP,显著优于基线模型Mask-RCNN(ResNeXt-101)的27.26 AP。
  • 在测试开发集上,该方法达到41.23 AP,比主办方提供的基线模型高出超过14分。
  • 掩码AP与边界框AP之间的性能差距缩小至2.3,较基线的2.9明显降低,表明掩码质量得到显著提升。
  • 消融实验表明,结合平衡组Softmax、新提议分配策略与平衡掩码损失,AP从33.2提升至38.8,提升5.6分。
  • 利用Open Images伪标签进行自训练与instaboost增强,使最终模型AP提升2.5分。
  • 测试时增强策略(包括基于尺度的过滤与稀有类别得分重加权)进一步将性能提升0.3–0.5 AP。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。