[论文解读] Revisiting 3D Medical Scribble Supervision: Benchmarking Beyond Cardiac Segmentation
本文提出部分损失(partial losses)——一种用于3D医学图像分割的简单而有效的方法,通过仅在标注体素上计算损失,利用涂鸦标注实现,可无缝集成至nnU-Net等最先进模型中。该方法在多种数据集上实现最先进性能,优于系统性方法与轻量化方法,且在不同解剖结构、成像模态及涂鸦风格下表现出稳健的泛化能力。
Scribble supervision has emerged as a promising approach for reducing annotation costs in medical 3D segmentation by leveraging sparse annotations instead of voxel-wise labels. While existing methods report strong performance, a closer analysis reveals that the majority of research is confined to the cardiac domain, predominantly using ACDC and MSCMR datasets. This over-specialization has resulted in severe overfitting, misleading claims of performance improvements, and a lack of generalization across broader segmentation tasks. In this work, we formulate a set of key requirements for practical scribble supervision and introduce ScribbleBench, a comprehensive benchmark spanning over seven diverse medical imaging datasets, to systematically evaluate the fulfillment of these requirements. Consequently, we uncover a general failure of methods to generalize across tasks and that many widely used novelties degrade performance outside of the cardiac domain, whereas simpler overlooked approaches achieve superior generalization. Finally, we raise awareness for a strong yet overlooked baseline, nnU-Net coupled with a partial loss, which consistently outperforms specialized methods across a diverse range of tasks. By identifying fundamental limitations in existing research and establishing a new benchmark-driven evaluation standard, this work aims to steer scribble supervision toward more practical, robust, and generalizable methodologies for medical image segmentation.
研究动机与目标
- 解决现有涂鸦监督方法泛化能力不足的问题,这些方法通常与特定分割架构紧密耦合,难以在医学影像任务间泛化。
- 克服稀疏标注评估局限于单一数据集(如心脏分割)的局限,通过在涵盖不同解剖结构与成像模态的多样化数据集上建立全面基准。
- 通过将学习机制与模型架构解耦,实现涂鸦监督在最先进分割框架中的无缝集成。
- 证明一种简单、模块化的方法——部分损失——可在无需架构修改的情况下超越复杂、任务特定的系统性方法。
提出的方法
- 提出部分损失,即部分交叉熵的推广形式,仅在标注体素上计算损失,从而实现从稀疏涂鸦中进行训练,同时保留分割模型的原始损失公式。
- 将部分损失扩展至其他常见分割损失(如Dice损失),以保持与nnU-Net等现代分割框架的兼容性。
- 设计一个涵盖七种多样化3D医学影像数据集的全面基准,覆盖不同器官、病理状态及成像模态(如MRI、CT),以评估在医学领域的泛化能力。
- 在所有数据集上系统比较部分损失与现有系统性及轻量化涂鸦方法,采用一致的评估协议与标注预算。
- 在固定标注预算下,评估不同涂鸦风格与标注策略(如涂鸦、逐层密集标注、随机图像采样)下的鲁棒性。
- 通过将部分损失应用于残差U-Net架构,验证其可移植性,确认其性能提升与主干模型无关。

实验结果
研究问题
- RQ1一个简单、模块化的损失公式——部分损失——是否可在不修改架构的前提下,在3D医学图像分割中实现最先进性能,且使用涂鸦标注?
- RQ2与现有系统性及轻量化涂鸦方法相比,部分损失在不同解剖结构、病理状态及成像模态下的泛化性能如何?
- RQ3在固定标注预算下,部分损失是否能在不同涂鸦风格与标注策略下保持一致的性能表现?
- RQ4部分损失是否可有效迁移至nnU-Net以外的其他最先进分割架构?
- RQ5为何以往的涂鸦监督方法在实践中未能获得广泛应用?系统性基准与模块化方法能否解决这些问题?
主要发现
- 在基准测试的全部数据集中,部分损失相比仅使用pCE的基线模型,平均Dice分数提升0.045,表明仅通过简单修改即可实现显著性能提升。
- 所提方法在基准测试的全部七个数据集中均达到最先进性能,其泛化能力与一致性优于系统性与轻量化方法。
- 部分损失在不同解剖区域(如心脏、肝脏、大脑、肾脏)、病理状态(如肿瘤、萎缩)及成像模态(MRI、CT)中表现出稳健的泛化能力,仅在BraTS数据集中因边界模糊而表现略逊,但所有方法均受此挑战影响。
- 在稀疏标注策略中,涂鸦标注在相同标注预算下优于逐层密集标注,而密集标注表现较差,原因在于标注图像数量更少,凸显了稀疏标注的效率优势。
- 定性分析表明,与系统性及轻量化方法相比,部分损失在复杂解剖区域产生最一致且准确的分割边界。
- 当将方法迁移至残差U-Net架构时,仍保持卓越性能,证实其模块化特性及在现代分割框架中的广泛适用性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。