[论文解读] Deep feature transfer between localization and segmentation tasks
本文提出了一种基于U-Net的视盘分割两阶段预训练方法,首先将编码器训练为定位网络以预测视盘中心,然后微调用于分割。该方法将定位任务中学到的语义特征迁移至分割任务,显著减少对标注分割掩码的需求,在仅使用较少标注数据的情况下实现了0.88的平均Dice系数。
In this paper, we propose a new pre-training scheme for U-net based image segmentation. We first train the encoding arm as a localization network to predict the center of the target, before extending it into a U-net architecture for segmentation. We apply our proposed method to the problem of segmenting the optic disc from fundus photographs. Our work shows that the features learned by encoding arm can be transferred to the segmentation network to reduce the annotation burden. We propose that an approach could have broad utility for medical image segmentation, and alleviate the burden of delineating complex structures by pre-training on annotations that are much easier to acquire.
研究动机与目标
- 通过利用更易标注的定位数据,减少医学图像分割中的标注负担。
- 探究从定位任务中学习到的特征是否能提升U-Net架构中的分割性能。
- 评估在视网膜眼底图像中,先对定位任务进行预训练再微调用于分割的有效性。
- 在不同数据可用性条件下,比较预训练模型与随机初始化U-Net的性能表现。
- 探索该方法在具有复杂结构的其他医学影像任务中的可扩展性。
提出的方法
- 首先将U-Net的编码器部分训练为回归网络,使用均方误差损失函数预测视盘中心的(x,y)坐标。
- 收敛后,冻结编码器权重并添加解码器,构建完整的U-Net用于分割。
- 使用负对数软Dice损失函数和Adam优化器,在二值掩码标注上训练分割网络。
- 在编码器和解码器特征之间添加跳跃连接,以在上采样过程中保留空间细节。
- 模型使用3×3卷积、批归一化、ReLU激活、最大池化和Dropout以防止过拟合。
- 采用两阶段训练方案:首先进行定位任务训练,然后共享编码器特征进行分割微调。
实验结果
研究问题
- RQ1从简单的定位任务中学习到的特征是否能提升医学图像中的分割性能?
- RQ2在定位数据上进行预训练是否能减少所需的分割标注数量?
- RQ3在低数据环境下,定位预训练的U-Net与随机初始化U-Net的性能相比如何?
- RQ4诸如形状、纹理和边界特征等语义特征,从定位任务到分割任务的可迁移程度如何?
- RQ5该方法是否可推广至具有复杂解剖结构的其他医学图像分割任务?
主要发现
- 所提方法在五折交叉验证的分割任务中,平均Dice系数为0.88,标准差为0.1。
- 预训练模型优于随机初始化的U-Net,后者平均Dice系数为0.84,标准差为0.2。
- 仅使用10%训练数据时,预训练模型的Dice系数显著高于基线模型(p < 3.97×10⁻¹²)。
- 两模型之间的性能差距在数据量较少时最为明显,表明在较少分割标签下具有更强的鲁棒性。
- 配对t检验显示在所有测试数据比例下均存在统计学显著差异(p < 0.05),证实了预训练的优势。
- 定位网络在验证集上的均方误差为132.16,在测试集上为206.15。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。