Skip to main content
QUICK REVIEW

[论文解读] Semi-supervised Active Learning for Instance Segmentation via Scoring Predictions

Jun Wang, Shaoguo Wen|arXiv (Cornell University)|Dec 9, 2020
Machine Learning and Algorithms参考文献 33被引用 12
一句话总结

本文提出了一种用于实例分割的新型半监督主动学习框架,采用三元组评分预测(TSP)联合评估分类、边界框和分割掩码分支的不确定性。通过将TSP与渐进式伪标签策略及平衡损失结合以减少噪声,该方法在医学图像数据集上实现了显著降低的标注成本,并取得了最先进性能。

ABSTRACT

Active learning generally involves querying the most representative samples for human labeling, which has been widely studied in many fields such as image classification and object detection. However, its potential has not been explored in the more complex instance segmentation task that usually has relatively higher annotation cost. In this paper, we propose a novel and principled semi-supervised active learning framework for instance segmentation. Specifically, we present an uncertainty sampling strategy named Triplet Scoring Predictions (TSP) to explicitly incorporate samples ranking clues from classes, bounding boxes and masks. Moreover, we devise a progressive pseudo labeling regime using the above TSP in semi-supervised manner, it can leverage both the labeled and unlabeled data to minimize labeling effort while maximize performance of instance segmentation. Results on medical images datasets demonstrate that the proposed method results in the embodiment of knowledge from available data in a meaningful way. The extensive quantitatively and qualitatively experiments show that, our method can yield the best-performing model with notable less annotation costs, compared with state-of-the-arts.

研究动机与目标

  • 通过减少对人工标注数据的依赖,解决实例分割的高标注成本问题。
  • 开发一种针对实例分割的系统性主动学习策略,联合考虑分类、边界框和分割掩码的不确定性。
  • 将半监督学习与主动学习相结合,有效利用未标注数据,并减少伪标签带来的噪声。
  • 在大规模医学图像数据集上验证该方法,证明其标签效率与鲁棒性。
  • 通过结合不确定性采样与自适应伪标签化,建立实例分割主动学习的新基准。

提出的方法

  • 提出三元组评分预测(TSP),一种新颖的不确定性采样策略,将分类、边界框和分割掩码预测得分整合为统一的不确定性度量。
  • 设计一种渐进式伪标签化机制,根据模型置信度迭代更新伪标注样本,并利用TSP得分优先选择高质量的未标注数据。
  • 引入一种带有超参数β的平衡损失函数,以控制监督训练与伪标签训练之间的权衡,最小化低置信度伪标签带来的噪声。
  • 采用基于Mask R-CNN的架构生成实例级预测,实现对每个实例的不确定性评分,支持选择性采样。
  • 应用迭代式主动学习循环:通过TSP查询最不确定的实例,获取人工标注,并使用标注数据与伪标签数据联合微调模型。
  • 采用动态β调度策略,随着主动学习迭代次数的增加而逐步降低,从而随时间减少噪声伪标签的影响。

实验结果

研究问题

  • RQ1一种同时考虑分类、边界框和分割掩码预测的统一不确定性评分机制,能否提升实例分割中主动学习的性能?
  • RQ2将主动学习与半监督伪标签化相结合,对实例分割中的模型性能与标注效率有何影响?
  • RQ3三元组评分中各类分量(类别、边界框、掩码)对模型性能与不确定性估计的影响如何?
  • RQ4采用平衡损失的渐进式伪标签化是否能减少噪声并提升泛化能力,相较于标准伪标签化?
  • RQ5在高成本实例分割任务中,实例级采样是否比图像级采样更有效?

主要发现

  • 所提方法在实例分割基准上实现了最先进性能,与现有主动学习方法相比,标注量最多减少30%。
  • 消融实验表明,三元组评分组件显著优于随机采样与基于类别熵的不确定性方法,当同时使用三类分支(类别、边界框、掩码)时性能最高。
  • 在TSP中引入掩码得分分支带来的性能提升最大,其次为边界框和分类得分,表明掩码级不确定性对选择最具信息量。
  • 损失平衡的最优β值为0.01,该值能有效减少伪标签噪声,并在泛化性能上优于更高值(0.05、0.09)。
  • 通过结合主动学习与半监督学习,该方法展现出卓越的鲁棒性与可复现性,在不同医学影像数据集中均表现出一致的性能提升。
  • 可视化结果证实,该方法能有效识别困难样本(低分预测)与简单样本(高分、近准确预测),从而实现有意义的采样与可靠的伪标签化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。