[论文解读] Rethinking Convolutional Semantic Segmentation Learning
该论文提出了一种用于卷积语义分割的联合端到端学习框架,通过协作学习设置,结合一种新型改进的残差Inception模块和部分注意力门控(PAG),在无需预训练模型的情况下同时训练分类和分割分支,实现了更快的收敛速度和更高的准确率。该方法在EyePACS数据集上实现了66.1的mIOU,即使在随机权重初始化下也优于需要ImageNet预训练的模型,达到当前最优性能。
Deep convolutional semantic segmentation (DCSS) learning doesn't converge to an optimal local minimum with random parameters initializations; a pre-trained model on the same domain becomes necessary to achieve convergence.In this work, we propose a joint cooperative end-to-end learning method for DCSS. It addresses many drawbacks with existing deep semantic segmentation learning; the proposed approach simultaneously learn both segmentation and classification; taking away the essential need of the pre-trained model for learning convergence. We present an improved inception based architecture with partial attention gating (PAG) over encoder information. The PAG also adds to achieve faster convergence and better accuracy for segmentation task. We will show the effectiveness of this learning on a diabetic retinopathy classification and segmentation dataset.
研究动机与目标
- 消除深度卷积语义分割中对预训练模型初始化的依赖以实现收敛。
- 通过允许使用部分或随机标签进行分类训练,缓解医学影像中的标签稀缺问题。
- 将分割与分类学习过程统一为单一的端到端框架。
- 通过分类与分割分支之间的协作学习机制,提升收敛速度和分割准确率。
- 在真实世界生物医学数据集(EyePACS)上验证该方法在糖尿病视网膜病变检测与微动脉瘤分割中的有效性。
提出的方法
- 提出一种协作学习框架,其中分割与分类代理共享参数,但使用独立的优化器,并并行训练。
- 采用改进的残差Inception模块,结合跳跃连接和批量归一化,以增强特征学习能力。
- 应用部分注意力门控(PAG)在解码器中选择性地使用中级编码器特征,提升分割的特征表示能力。
- 为分类代理使用更大的批量大小和更高的初始学习率,以加速信息向分割代理的传递。
- 采用Nesterov动量优化,并结合多项式学习率衰减和批量归一化,以减少协变量偏移。
- 基于TensorFlow构建自定义框架(TEFLA)用于训练与评估。
实验结果
研究问题
- RQ1深度语义分割是否能在无预训练模型初始化的情况下收敛至最优局部极小值?
- RQ2联合训练分类与分割任务是否能提升分割性能,同时减少对标注分割数据的依赖?
- RQ3分类头是否能有效在部分或随机标签上进行训练,而不会损害分割性能?
- RQ4所提出的结合部分注意力门控的协作学习框架是否能实现比标准编码器-解码器模型更快的收敛速度和更高的准确率?
- RQ5联合模型是否能在二分类糖尿病视网膜病变分类任务中超越人类眼科医生的表现?
主要发现
- 所提出的JointSeg模型在EyePACS测试集上实现了66.1的mIOU,显著优于使用预训练权重的FCN-8s(55.3)和UNet(64.4)。
- 在随机权重初始化下,FCN-8s和UNet的mIOU分别仅为15.3和25.4,表明其在无预训练时收敛性能差,而JointSeg仍保持66.1的mIOU。
- 分类代理在EyePACS测试集上达到85.1%的top-1准确率和88.1%的top-2准确率,优于VGG-19(82.5%和85.3%)与InceptionV3(84.3%和87.2%)。
- 在二分类糖尿病视网膜病变分类任务中,联合模型达到95.5%的准确率,略高于人类眼科医生的表现(95.1%)。
- 定性结果表明,JointSeg生成的分割掩码比改进的UNet基线更精确、更精细,尤其在微小微动脉瘤的分割上表现更优。
- 该方法可在部分或随机标签上有效训练分类头,而不会降低分割性能,有效缓解了医学影像中的数据稀缺问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。