Skip to main content
QUICK REVIEW

[论文解读] Uncertainty-Driven Semantic Segmentation through Human-Machine Collaborative Learning

Mahdyar Ravanbakhsh, Tassilo Klein|arXiv (Cornell University)|Sep 2, 2019
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

本文提出了一种基于不确定性的、人机协同的语义分割框架,利用条件生成对抗网络(conditional GANs)降低医学影像中的标注成本。通过将判别器的输出作为不确定性度量,该方法主动选择最不确定(分布外)的切片进行专家标注,仅使用全监督方法所需80%的标注数据,即实现了接近最先进水平的性能。

ABSTRACT

Deep learning-based approaches achieve state-of-the-art performance in the majority of image segmentation benchmarks. However, training of such models requires a sizable amount of manual annotations. In order to reduce this effort, we propose a method based on conditional Generative Adversarial Network (cGAN), which addresses segmentation in a semi-supervised setup and in a human-in-the-loop fashion. More specifically, we use the discriminator to identify unreliable slices for which expert annotation is required and use the generator in the GAN to synthesize segmentations on unlabeled data for which the model is confident. The quantitative results on a conventional standard benchmark show that our method is comparable with the state-of-the-art fully supervised methods in slice-level evaluation requiring far less annotated data.

研究动机与目标

  • 降低训练深度学习模型进行医学图像分割的高昂标注成本。
  • 通过实现高效的机人协同,缓解医学影像中的数据稀缺问题。
  • 开发一种半监督主动学习框架,在最小化专家标注的同时保持高分割精度。
  • 利用条件生成对抗网络中的判别器作为可靠不确定性估计器,以选择需要人工标注的样本。
  • 在显著少于全监督方法所需标注数据的情况下,实现与全监督模型相当的性能。

提出的方法

  • 使用U-Net生成器和Patch GAN判别器训练条件生成对抗网络(cGAN),实现图像到分割图的转换。
  • 将判别器的输出分数用作模型不确定性的度量,对未标注数据的预测结果进行排序。
  • 在每个主动学习周期中,选择不确定性最高的k个预测结果(判别器分数最低)进行专家标注。
  • 利用训练好的生成器对剩余高置信度预测结果生成伪标签。
  • 在真实专家标注数据与合成伪标签的组合数据集上,迭代微调生成器和判别器。
  • 在HVSMR 2016挑战赛提供的3D心血管磁共振图像上采用10折交叉验证评估性能。

实验结果

研究问题

  • RQ1条件生成对抗网络中的判别器分数能否作为医学图像分割中主动学习的可靠不确定性估计?
  • RQ2在保持高分割精度的前提下,人机协同标注可在多大程度上被最小化?
  • RQ3与全监督基线相比,所提方法在标注数据量增加时的性能表现如何变化?
  • RQ4在高置信度样本上使用生成器生成的伪标签,是否能提升半监督设置下的模型泛化能力?
  • RQ5所提方法是否能在远少于全监督方法所需标注数据的情况下,实现接近最先进水平的性能?

主要发现

  • 观察到判别器分数与分割质量之间存在强相关性(r = 0.98,p < 0.001),验证了判别器作为可靠不确定性估计器的有效性。
  • 仅使用全监督基线80%的标注数据,所提方法在心肌组织上达到0.85的平均Dice分数,在血池上达到0.94,接近最先进性能。
  • 在使用90%标注数据时,心肌组织Dice分数达到0.73,血池为0.95,与全监督SOTA模型(如Isola et al., 2017)相当或更优。
  • 随着标注预算的增加,性能单调提升,证明了基于不确定性的采样策略在主动学习中的有效性。
  • 在高置信度样本上使用伪标签显著减少了对专家标注的需求,且未降低模型性能。
  • 仅使用70%的标注数据,方法即达到82%的平均Dice分数,表明其具有极强的数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。