[论文解读] Toward Unpaired Multi-modal Medical Image Segmentation via Learning Structured Semantic Consistency
该论文提出了一种新颖的无配对多模态医学图像分割方法,采用单一Transformer主干网络,并通过即插即用的外部注意力模块(EAM)增强,以学习CT和MRI等模态之间的结构化语义一致性。通过在不依赖配对数据的情况下对齐全局类别嵌入和图像级语义相关性,该方法实现了最先进性能,在两项分割任务中分别将平均Dice分数提高了2.6%和2.5%,且在推理阶段移除EAM以保持模型简洁。
Integrating multi-modal data to promote medical image analysis has recently gained great attention. This paper presents a novel scheme to learn the mutual benefits of different modalities to achieve better segmentation results for unpaired multi-modal medical images. Our approach tackles two critical issues of this task from a practical perspective: (1) how to effectively learn the semantic consistencies of various modalities (e.g., CT and MRI), and (2) how to leverage the above consistencies to regularize the network learning while preserving its simplicity. To address (1), we leverage a carefully designed External Attention Module (EAM) to align semantic class representations and their correlations of different modalities. To solve (2), the proposed EAM is designed as an external plug-and-play one, which can be discarded once the model is optimized. We have demonstrated the effectiveness of the proposed method on two medical image segmentation scenarios: (1) cardiac structure segmentation, and (2) abdominal multi-organ segmentation. Extensive results show that the proposed method outperforms its counterparts by a wide margin.
研究动机与目标
- 解决无配对多模态医学图像(如CT和MRI)分割的挑战,其中不存在像素级对应关系。
- 在无需空间对齐数据的情况下,克服多模态分割中的域偏移和模态差异。
- 学习跨模态的结构化语义一致性——包括类别表征和类别间相关性——以提升模型泛化能力。
- 设计一种轻量化、模块化的组件(EAM),可在训练后移除,以保持模型简洁性和推理效率。
- 在数据不平衡情况下实现有效模态间知识迁移,即某一模态样本数量少于另一模态。
提出的方法
- 使用共享的Transformer主干网络从无配对的CT和MRI图像中提取多尺度特征。
- 为每个语义类别引入模态特定的可学习类别嵌入,以表示每种模态的全局类别级特征。
- 将特征图和类别嵌入输入外部注意力模块(EAM),以在多尺度下捕捉特定于图像的类别表征和类别间相关性。
- 通过在模态级和图像级均施加一致性正则化,强制实现结构化语义一致性,对齐跨模态的类别表征及其相关性。
- 在训练时激活EAM模块,推理时将其移除,以保持轻量化、单一Transformer主干的分割头结构。
- 利用ImageNet预训练来稳定训练,以应对医学数据有限的问题。
实验结果
研究问题
- RQ1在无配对数据或空间对齐的情况下,能否有效学习无配对多模态医学图像(如CT和MRI)之间的结构化语义一致性?
- RQ2如何对齐模态特定和图像特定的语义表征,以提升在域偏移下的分割鲁棒性?
- RQ3即插即用的注意力模块是否能增强语义一致性学习,同时实现训练后的模型简化?
- RQ4在无配对设置下,低资源模态在多大程度上能提升高资源模态的性能?
- RQ5该方法在具有不同数据分布的2D和3D医学图像分割任务中,泛化能力如何?
主要发现
- 与最先进基线方法相比,该方法在心脏结构分割任务中实现了2.6%的平均Dice分数提升。
- 在腹部多器官分割任务中,该方法相比现有方法将平均Dice分数提升了2.5%,展现出强大的泛化能力。
- 即使在少样本设置下(某一模态的训练样本显著少于另一模态),模型仍保持高性能。
- 样本较少的模态仍能有效提升样本较多模态的训练效果,表明模态间知识迁移有效。
- EAM模块可在训练后成功移除,从而得到一个轻量化推理模型,仅保留单一Transformer主干。
- ImageNet预训练显著提升了性能,凸显了在低数据医学分割设置中初始化的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。