[论文解读] Dual Cross-Attention for Medical Image Segmentation
本文提出双交叉注意力(Dual Cross-Attention, DCA),一种轻量级注意力模块,通过在多尺度编码器特征中依次建模通道级和空间依赖关系,利用交叉注意力机制增强基于U-Net的医学图像分割模型中的跳跃连接。DCA在五个基准数据集上实现了最高达2.05%的Dice分数提升,有效缩小了编码器与解码器特征之间的语义差距,且未显著增加模型复杂度。
We propose Dual Cross-Attention (DCA), a simple yet effective attention module that is able to enhance skip-connections in U-Net-based architectures for medical image segmentation. DCA addresses the semantic gap between encoder and decoder features by sequentially capturing channel and spatial dependencies across multi-scale encoder features. First, the Channel Cross-Attention (CCA) extracts global channel-wise dependencies by utilizing cross-attention across channel tokens of multi-scale encoder features. Then, the Spatial Cross-Attention (SCA) module performs cross-attention to capture spatial dependencies across spatial tokens. Finally, these fine-grained encoder features are up-sampled and connected to their corresponding decoder parts to form the skip-connection scheme. Our proposed DCA module can be integrated into any encoder-decoder architecture with skip-connections such as U-Net and its variants. We test our DCA module by integrating it into six U-Net-based architectures such as U-Net, V-Net, R2Unet, ResUnet++, DoubleUnet and MultiResUnet. Our DCA module shows Dice Score improvements up to 2.05% on GlaS, 2.74% on MoNuSeg, 1.37% on CVC-ClinicDB, 1.12% on Kvasir-Seg and 1.44% on Synapse datasets. Our codes are available at: https://github.com/gorkemcanates/Dual-Cross-Attention
研究动机与目标
- 解决基于U-Net的架构在医学图像分割中编码器与解码器特征之间的语义差距问题。
- 通过建模多尺度编码器特征中的长程依赖关系,提升跳跃连接的性能。
- 设计一种轻量级、即插即用的注意力模块,增强特征融合,同时不增加计算开销。
- 在多种U-Net变体和基准数据集上验证DCA的有效性。
提出的方法
- DCA采用通道交叉注意力(Channel Cross-Attention, CCA)通过在多尺度编码器特征的通道令牌之间应用交叉注意力,捕捉全局通道级依赖关系。
- 随后应用空间交叉注意力(Spatial Cross-Attention, SCA),通过在特征图的空间令牌之间交叉注意,建模空间依赖关系。
- CCA与SCA模块按CCA-SCA顺序依次应用,特征图通过2D平均池化进行块嵌入,通过1×1深度可分离卷积进行投影。
- 增强后的编码器特征被上采样,并通过跳跃连接与对应的解码器层连接,取代标准的拼接操作。
- DCA模块设计为可轻松集成到任意具有跳跃连接的U-Net架构中。
- 消融研究对比了融合策略(相加、拼接、顺序)以及块嵌入方法(平均池化与卷积)的性能。
实验结果
研究问题
- RQ1一种按顺序建模通道与空间依赖关系的双注意力机制,是否能提升基于U-Net的分割任务中的特征表示?
- RQ2通道与空间交叉注意力的顺序(CCA-SCA 与 SCA-CCA)中,哪种能获得最优性能?
- RQ3哪种融合策略(相加、拼接、顺序)最能有效结合通道与空间注意力输出?
- RQ4在性能与参数效率方面,平均池化与卷积块嵌入方法相比表现如何?
主要发现
- CCA-SCA顺序布局表现最佳,在GlaS数据集上提升0.79% Dice分数,在MoNuSeg上提升0.16%,优于单一模块。
- 顺序融合(先CCA后SCA)优于相加与拼接策略,在GlaS数据集上实现2.05%的Dice分数提升。
- 使用2D平均池化进行块嵌入优于卷积块嵌入,在GlaS数据集上Dice分数高出0.14%,且参数量更少。
- DCA在六种U-Net变体中均提升分割性能,其中在MoNuSeg上提升2.74%,在Synapse上提升1.44%,在CVC-ClinicDB上提升1.37%。
- DCA模块保持了较低的计算成本,仅带来轻微的参数增加(如U-Net中参数从8.64M增至8.75M),但性能提升稳定。
- 该方法泛化能力强,在GlaS、MoNuSeg、CVC-ClinicDB、Kvasir-Seg和Synapse等多样化数据集上均表现出显著改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。