[论文解读] Learning to Segment Medical Images with Scribble-Supervision Alone
本文提出了一种弱监督学习框架,仅使用涂抹标注进行医学图像语义分割,通过条件随机场(CRFs)和不确定性估计的迭代训练实现。尽管监督信号稀疏,该方法在心脏和前列腺数据集上分别仅导致2.9%和4.5%的Dice分数下降——表明在极少专家标注投入的情况下实现了接近全监督的性能。
Semantic segmentation of medical images is a crucial step for the quantification of healthy anatomy and diseases alike. The majority of the current state-of-the-art segmentation algorithms are based on deep neural networks and rely on large datasets with full pixel-wise annotations. Producing such annotations can often only be done by medical professionals and requires large amounts of valuable time. Training a medical image segmentation network with weak annotations remains a relatively unexplored topic. In this work we investigate training strategies to learn the parameters of a pixel-wise segmentation network from scribble annotations alone. We evaluate the techniques on public cardiac (ACDC) and prostate (NCI-ISBI) segmentation datasets. We find that the networks trained on scribbles suffer from a remarkably small degradation in Dice of only 2.9% (cardiac) and 4.5% (prostate) with respect to a network trained on full annotations.
研究动机与目标
- 通过仅使用涂抹标注训练完全自动化的像素级分割网络,减少对昂贵全像素标注的依赖。
- 探究仅使用涂抹标注是否能够生成与全监督基线性能相当的高性能分割模型。
- 开发并评估利用CRFs和不确定性估计迭代优化伪标签的训练策略,以提高分割精度。
- 证明在真实世界医学影像数据集上,通过极少标注投入实现弱监督学习的可行性。
提出的方法
- 该方法采用迭代两步框架:首先,在初始涂抹标注上训练CNN;其次,利用网络预测结果与CRF生成训练集的优化伪标签。
- 通过区域生长步骤,应用高阈值基于随机游走的分割方法,生成具有高置信度预测的种子区域,并将不确定像素视为隐变量。
- 评估了两种CRF策略:手工调参的传统密集CRF,以及端到端优化CRF参数的可学习CRF-RNN。
- 通过蒙特卡洛Dropout估计不确定性,该方法被整合到重新标注过程中,以提升鲁棒性并减少预测的过度自信。
- 将迭代过程解释为硬期望最大化(EM)近似,其中网络权重与伪标签交替优化。
- 在ACDC(心脏)和NCI-ISBI(前列腺)数据集上进行评估,采用2D切片级别的训练与验证。
实验结果
研究问题
- RQ1是否可以仅使用涂抹标注训练全卷积网络,在医学图像上实现准确的语义分割,而无需任何全像素标注?
- RQ2在弱监督条件下,利用CRFs和不确定性估计进行迭代优化策略在提升分割性能方面的有效性如何?
- RQ3在真实医学影像基准上,涂抹标注监督模型与全监督基线之间的Dice分数差距有多大?
- RQ4在弱监督医学分割中,可学习的CRF-RNN模块是否优于传统CRF?
- RQ5不确定性估计、CRF优化和递归机制各自以及协同作用对最终分割精度的贡献如何?
主要发现
- 与全监督基线相比,所提方法在心脏ACDC数据集上仅导致2.9%的Dice分数下降,在前列腺NCI-ISBI数据集上为4.5%。
- 表现最佳的配置——结合CRF-RNN与不确定性估计——在心脏结构上达到0.880的Dice分数,在前列腺结构上达到0.781,优于所有其他变体。
- 使用蒙特卡洛Dropout进行不确定性估计带来了最大的性能提升,Dice分数最高提升0.015。
- 即使不使用不确定性估计,CRF-RNN模块的性能也与带不确定性估计的独立CRF相当,表明RNN内部的优化已具鲁棒性。
- 在前列腺数据集上,向CRF-RNN添加不确定性估计并未提升性能,反而略有下降,可能由于RNN产生的logit分布非标准。
- 递归训练策略显著优于非递归训练,最佳方法达到了全监督模型95%的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。