Skip to main content
QUICK REVIEW

[论文解读] mmFormer: Multimodal Medical Transformer for Incomplete Multimodal Learning of Brain Tumor Segmentation

Yao Zhang, Nanjun He|arXiv (Cornell University)|Jun 6, 2022
Advanced Neural Network Applications被引用 12
一句话总结

该论文提出 mmFormer,一种多模态医学 Transformer 模型,通过结合模态特定编码器、用于全局特征对齐的模态间 Transformer 以及带有辅助正则化的渐进式解码器,在多模态 MRI 条件不完整的情况下实现鲁棒的脑肿瘤分割。当仅有一种模态可用时,其在增强肿瘤分割上的平均 Dice 分数相比现有方法提升了 19.07%,在不完整与完整多模态设置下均优于当前最先进方法。

ABSTRACT

Accurate brain tumor segmentation from Magnetic Resonance Imaging (MRI) is desirable to joint learning of multimodal images. However, in clinical practice, it is not always possible to acquire a complete set of MRIs, and the problem of missing modalities causes severe performance degradation in existing multimodal segmentation methods. In this work, we present the first attempt to exploit the Transformer for multimodal brain tumor segmentation that is robust to any combinatorial subset of available modalities. Concretely, we propose a novel multimodal Medical Transformer (mmFormer) for incomplete multimodal learning with three main components: the hybrid modality-specific encoders that bridge a convolutional encoder and an intra-modal Transformer for both local and global context modeling within each modality; an inter-modal Transformer to build and align the long-range correlations across modalities for modality-invariant features with global semantics corresponding to tumor region; a decoder that performs a progressive up-sampling and fusion with the modality-invariant features to generate robust segmentation. Besides, auxiliary regularizers are introduced in both encoder and decoder to further enhance the model's robustness to incomplete modalities. We conduct extensive experiments on the public BraTS $2018$ dataset for brain tumor segmentation. The results demonstrate that the proposed mmFormer outperforms the state-of-the-art methods for incomplete multimodal brain tumor segmentation on almost all subsets of incomplete modalities, especially by an average 19.07% improvement of Dice on tumor segmentation with only one available modality. The code is available at https://github.com/YaoZhang93/mmFormer.

研究动机与目标

  • 解决在临床实践中当一种或多种 MRI 模态(T1、T1c、T2、FLAIR)缺失时,多模态脑肿瘤分割性能严重下降的挑战。
  • 开发一种统一的深度学习模型,无需微调即可泛化于所有可能的可用模态子集。
  • 利用 Transformer 的长程建模能力,学习模态不变表示,以提升对不完整数据的鲁棒性。
  • 在编码器和解码器中集成辅助正则化器,进一步增强对缺失模态的鲁棒性。
  • 在 BraTS 2018 数据集上,于不完整与完整多模态分割基准中均优于现有方法。

提出的方法

  • 该模型使用四个混合模态特定编码器,每个编码器结合卷积主干网络与模态内 Transformer,以捕捉每种 MRI 模态内的局部与全局上下文信息。
  • 引入模态间 Transformer,用于建立并对齐模态间的长程相关性,生成具有全局语义的模态不变特征,用于肿瘤区域。
  • 采用渐进式上采样与特征融合的解码器,利用模态不变特征生成最终的分割掩码。
  • 在编码器和解码器分支中均应用辅助正则化器,以提升在模态缺失条件下的泛化能力。
  • 模型在 BraTS 2018 数据集上端到端训练,使用所有可用模态,并在所有 15 种模态缺失组合下进行测试。
  • 通过增强肿瘤、肿瘤核心和全肿瘤子区域的 Dice 相似性系数(DSC)评估方法。

实验结果

研究问题

  • RQ1统一的基于 Transformer 的架构是否能在所有可能的缺失 MRI 模态子集中实现鲁棒的脑肿瘤分割?
  • RQ2模态内与模态间 Transformer 的集成如何提升不完整多模态学习中的特征表示?
  • RQ3辅助正则化器在模态缺失时能在多大程度上增强模型鲁棒性?
  • RQ4所提出方法是否在不完整与完整多模态分割设置下均优于现有最先进方法?
  • RQ5随着缺失模态数量的增加,性能如何退化?mmFormer 在此类场景中是否仍保持优势?

主要发现

  • 当仅有一种模态可用时,mmFormer 在增强肿瘤分割上的平均 Dice 分数相比 HeMIS 和 U-HVED 提升了 19.07%。
  • 在所有 15 种模态缺失组合中,mmFormer 在全肿瘤分割中优于 HeMIS 和 U-HVED 的 12 种情况,且在增强肿瘤与肿瘤核心分割中所有情况下均表现更优。
  • 当三种模态缺失时,mmFormer 在肿瘤核心上相比 HeMIS 实现 15.34% 的平均 Dice 分数提升,在全肿瘤上提升 11.75%。
  • 在完整多模态设置下,mmFormer 超过基于 Transformer 的 TransBTS,全肿瘤 DSC 达 89.64%,高于 TransBTS 的 79.99%。
  • 消融实验证实,模态间 Transformer、模态内 Transformer 和辅助正则化器均对性能有显著贡献,三者联合使用时效果最佳。
  • 该模型仅需 25 小时训练时间与 106M 参数,而 ACN 需要 672 小时与 144M 参数来训练 15 个独立的学生模型以覆盖所有模态缺失组合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。