[论文解读] A Data-scalable Transformer for Medical Image Segmentation: Architecture, Model Efficiency, and Benchmark
MedFormer 是一个数据可扩展的 Transformer,用于3D 医学影像分割,从头训练不进行预训练,在七个公开数据集上优于 CNNs 和许多 Transformers,具备强数据效率和领域鲁棒性。
Transformers have demonstrated remarkable performance in natural language processing and computer vision. However, existing vision Transformers struggle to learn from limited medical data and are unable to generalize on diverse medical image tasks. To tackle these challenges, we present MedFormer, a data-scalable Transformer designed for generalizable 3D medical image segmentation. Our approach incorporates three key elements: a desirable inductive bias, hierarchical modeling with linear-complexity attention, and multi-scale feature fusion that integrates spatial and semantic information globally. MedFormer can learn across tiny- to large-scale data without pre-training. Comprehensive experiments demonstrate MedFormer's potential as a versatile segmentation backbone, outperforming CNNs and vision Transformers on seven public datasets covering multiple modalities (e.g., CT and MRI) and various medical targets (e.g., healthy organs, diseased tissues, and tumors). We provide public access to our models and evaluation pipeline, offering solid baselines and unbiased comparisons to advance a wide range of downstream clinical applications.
研究动机与目标
- 推动以数据为中心的医学影像分割,解决数据有限、标注成本高和领域偏移等问题。
- 提出一个统一、可扩展的 Transformer 主干,能够在没有预训练的情况下处理3D医学影像。
- 引入架构性归纳偏置、高效注意力,以及全局多尺度融合,以提升泛化能力。
- 在多样化数据集和模态下评估 MedFormer 相对于 CNNs 与 Transformer 基线的表现。
提出的方法
- 通过深度可分卷积在投影和前馈网络中引入卷积型归纳偏置。
- 开发双向多头注意力(B-MHA),通过语义地图将注意力复杂度从平方级降低到近线性。
- 实现全局多尺度语义地图融合机制以整合跨尺度上下文。
- 用卷积干预头、分层的 B-MHA 块,以及带深层监督的解码器构建 MedFormer。
- 实现从极小数据集到大数据集的无预训练数据规模评估。
实验结果
研究问题
- RQ1从零开始训练的数据可扩展 Transformer 是否能在多样化的医学影像任务上达到最先进的分割性能?
- RQ2B-MHA 是否在保持全局关系的同时实现线性或近线性注意力复杂度,适用于高分辨率的3D数据?
- RQ3全局多尺度语义地图融合是否在不产生不可承受计算成本的情况下改善边界描绘?
- RQ4相对于 CNN 和基于 ViT 的模型,MedFormer 在未知领域和不同厂商的数据上具有怎样的泛化能力?
主要发现
- MedFormer 在从极小到大规模的数据上均实现优越表现且无需预训练。
- 在大型心脏 MRI 数据集上,MedFormer 获得 5%: 87.72, 10%: 87.99, 40%: 88.80, 70%: 88.92, 100%: 89.05 的 Dice 分数,优于多个基线。
- MedFormer 使用更少的参数和适中的 FLOPs,仍能提供强精度,这归功于 B-MHA 实现近线性复杂度。
- MedFormer 展现出对领域偏移的鲁棒性,在未见领域 C 和 D 上保持高性能,尤其在低数据条件下。
- 在七个公开的3D分割数据集上,MedFormer 始终优于 nnUNet 和许多基于 Transformer 的模型,表明具有较强的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。