[论文解读] Enhanced U-Net: A Feature Enhancement Network for Polyp Segmentation
该论文提出了一种增强型U-Net,引入了两个新型模块——语义特征增强模块(SFEM)和自适应全局上下文模块(AGCM),以提升结肠镜图像中的息肉分割性能。SFEM利用多尺度非局部注意力机制丰富深层语义特征,而AGCM则通过解码器引导的空间交叉注意力机制自适应地聚合显著的细粒度编码器特征,从而在五个基准数据集上实现了最先进性能,Dice分数最高比U-Net高出12.09%。
Colonoscopy is a procedure to detect colorectal polyps which are the primary cause for developing colorectal cancer. However, polyp segmentation is a challenging task due to the diverse shape, size, color, and texture of polyps, shuttle difference between polyp and its background, as well as low contrast of the colonoscopic images. To address these challenges, we propose a feature enhancement network for accurate polyp segmentation in colonoscopy images. Specifically, the proposed network enhances the semantic information using the novel Semantic Feature Enhance Module (SFEM). Furthermore, instead of directly adding encoder features to the respective decoder layer, we introduce an Adaptive Global Context Module (AGCM), which focuses only on the encoder's significant and hard fine-grained features. The integration of these two modules improves the quality of features layer by layer, which in turn enhances the final feature representation. The proposed approach is evaluated on five colonoscopy datasets and demonstrates superior performance compared to other state-of-the-art models.
研究动机与目标
- 为解决结肠镜图像中息肉分割面临的挑战,包括形状、大小、颜色、纹理的多样性,低对比度以及背景混淆等问题。
- 通过增强语义上下文而不损失空间信息,改进基于U-Net模型的特征表示能力。
- 利用注意力机制有选择性地将编码器中最重要的、细粒度的特征聚合到解码器中。
- 通过自适应特征精炼和多尺度上下文建模,提升模型在未见数据集上的泛化能力和鲁棒性。
- 通过一种新颖的、基于注意力机制的特征增强策略,在多个公开结肠镜图像数据集上超越现有最先进方法。
提出的方法
- 语义特征增强模块(SFEM)应用多个感受野不同的局部块非局部注意力模块,以捕捉多尺度息肉特征,并融合输出以丰富深层语义表征。
- 自适应全局上下文模块(AGCM)利用解码器特征与编码器特征之间的空间交叉注意力机制,有选择性地关注并聚合编码器中最具代表性的、难以分割的特征。
- AGCM基于解码器特征动态计算注意力权重,抑制噪声和无关特征,同时聚焦于细粒度、判别性区域。
- 在每个解码器层应用复合损失函数,结合Dice损失、焦点损失和加权IoU损失,以突出强调难分类的正负样本。
- 将SFEM生成的增强特征与AGCM处理后的特征在每个解码器层进行拼接,实现特征表征的迭代优化。
- 模型采用端到端训练并结合深度监督,每个解码器层均应用辅助损失,以稳定训练过程并改善梯度流动。
实验结果
研究问题
- RQ1多尺度非局部注意力机制是否能在不牺牲空间分辨率的前提下提升息肉分割中的语义特征表征?
- RQ2基于解码器引导的注意力机制是否能改善对相关编码器特征的选择,特别是在难以分割的区域?
- RQ3自适应全局上下文建模的引入是否能带来在未见结肠镜图像数据集上的更好泛化性能?
- RQ4所提出的复合损失函数在提升难正负样本学习方面有多大作用?
- RQ5所提出的增强型U-Net在多种数据集上的分割精度和鲁棒性方面,与最先进模型相比表现如何?
主要发现
- 在EndoScene数据集上,所提模型相比基线U-Net的Dice分数提高12.09%,IoU提高16.06%。
- 在Kvasir-SEG数据集上,模型Dice分数提升9.73%,IoU提升13.61%,优于ACSNet和PraNet。
- 在ColonDB数据集上,模型平均Dice分数提高22.79%,平均IoU提高21.48%,展现出强大的泛化能力。
- 在ETIS数据集上,模型平均Dice分数提高25.25%,平均IoU提高24.7%,表明对多种息肉形态具有强鲁棒性。
- 在CVC-300数据集上,模型平均Dice分数提高17.62%,平均IoU提高18.6%,证实了在各类基准上的稳定表现。
- 消融实验表明,SFEM与AGCM各自均能提升性能,其中AGCM在set-2上贡献最高达6.06%的Dice分数提升,复合损失函数在set-1上使Dice分数提升8.46%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。