[论文解读] Self-Supervised Learning for Segmentation
本文提出了一种基于解剖不对称性的自监督代理任务,用于腹部CT扫描中的肾脏分割。通过使用孪生CNN对左右肾脏区域进行分类,该方法在无需额外标注的情况下进行预训练,相比从零开始训练,实现了更快的收敛速度和更高的分割性能(Dice分数0.931对比0.907),即使仅使用1/5的训练轮次且无数据增强。
Self-supervised learning is emerging as an effective substitute for transfer learning from large datasets. In this work, we use kidney segmentation to explore this idea. The anatomical asymmetry of kidneys is leveraged to define an effective proxy task for kidney segmentation via self-supervised learning. A siamese convolutional neural network (CNN) is used to classify a given pair of kidney sections from CT volumes as being kidneys of the same or different sides. This knowledge is then transferred for the segmentation of kidneys using another deep CNN using one branch of the siamese CNN as the encoder for the segmentation network. Evaluation results on a publicly available dataset containing computed tomography (CT) scans of the abdominal region shows that a boost in performance and fast convergence can be had relative to a network trained conventionally from scratch. This is notable given that no additional data/expensive annotations or augmentation were used in training.
研究动机与目标
- 为解决肾脏分割中医学影像标注数据有限的挑战。
- 探索自监督学习作为医学图像分割中迁移学习的替代方案。
- 设计一种利用固有解剖不对称性进行有效预训练的代理任务。
- 评估自监督学习是否能在不使用额外标注数据或数据增强的情况下提升分割性能与收敛速度。
提出的方法
- 使用孪生卷积神经网络(CNN)对来自CT影像体积的空间裁剪64×112×112块进行配对分类,判断其是否属于同一侧肾脏。
- 代理任务利用了解剖不对称性——左右肾脏在大小、形状和位置上的差异,迫使网络学习结构语义信息,而非依赖空间位置。
- 采用对比损失函数,最小化同侧配对嵌入之间的L2距离,同时最大化异侧配对之间的距离,损失函数的边界值为1。
- 预训练完成后,将孪生网络的一个分支作为分割网络的编码器,而解码器则随机初始化。
- 分割网络采用软Dice损失(0.4)与二值交叉熵损失(0.6)的加权组合进行训练。
- 该方法仅使用原始数据集,未进行任何数据增强,且输入影像通过零填充至最接近的16的倍数,以适应可变尺寸输入。
实验结果
研究问题
- RQ1基于解剖不对称性的自监督代理任务是否能提升腹部CT扫描中肾脏分割的性能?
- RQ2与从零开始训练相比,自监督预训练是否能实现更快的收敛速度?
- RQ3自监督学习是否能在不使用额外标注数据或数据增强的情况下实现更优性能?
- RQ4孪生网络结合对比损失在学习用于分割的判别性肾脏表征方面效果如何?
主要发现
- 采用自监督的模型(MwS)在验证集上的Dice分数达到0.931,而从零开始训练的模型(MwoS)为0.907,表明性能有显著提升。
- MwS模型收敛更快,在训练早期即达到更高的Dice分数,如训练轮次曲线所示。
- 在测试集(90例未标注病例)上,MwS的Dice分数为0.880,而MwoS为0.853,表明性能提升具有一致性。
- Hausdorff距离从MwoS的0.303降低至MwS的0.291,表明边界对齐更优。
- 边界长度差异(BL)从MwoS的14.0%降低至MwS的12.9%,表明分割边界更精确。
- 尽管仅使用1/5的训练轮次(200轮对比1000轮)且无数据增强,MwS仍优于使用6折数据增强和1000轮训练的最先进方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。