[论文解读] TransMed: Transformers Advance Multi-modal Medical Image Classification
TransMed 提出了一种用于多模态医学图像分类的混合 CNN-Transformer 架构,通过自注意力机制建模跨模态的长距离依赖关系,同时利用 CNN 进行局部特征提取。其在腮腺肿瘤分类任务上实现了最先进性能,准确率达到 87.0%(TransMed-T),且参数量和 FLOPs 显著少于先前方法。
Over the past decade, convolutional neural networks (CNN) have shown very competitive performance in medical image analysis tasks, such as disease classification, tumor segmentation, and lesion detection. CNN has great advantages in extracting local features of images. However, due to the locality of convolution operation, it can not deal with long-range relationships well. Recently, transformers have been applied to computer vision and achieved remarkable success in large-scale datasets. Compared with natural images, multi-modal medical images have explicit and important long-range dependencies, and effective multi-modal fusion strategies can greatly improve the performance of deep models. This prompts us to study transformer-based structures and apply them to multi-modal medical images. Existing transformer-based network architectures require large-scale datasets to achieve better performance. However, medical imaging datasets are relatively small, which makes it difficult to apply pure transformers to medical image analysis. Therefore, we propose TransMed for multi-modal medical image classification. TransMed combines the advantages of CNN and transformer to efficiently extract low-level features of images and establish long-range dependencies between modalities. We evaluated our model for the challenging problem of preoperative diagnosis of parotid gland tumors, and the experimental results show the advantages of our proposed method. We argue that the combination of CNN and transformer has tremendous potential in a large number of medical image analysis tasks. To our best knowledge, this is the first work to apply transformers to medical image classification.
研究动机与目标
- 解决 CNN 在捕捉多模态医学图像中长距离依赖关系方面的局限性。
- 通过将 Transformer 与 CNN 结合,克服纯 Transformer 在小规模医学数据集上表现不佳的问题。
- 开发一种高效的多模态融合策略,以低计算成本有效建模模态间关系。
- 证明 Transformer 在医学图像分类中的有效性,尤其在需要整合多样化成像模态的任务中。
- 提出一种灵活且可扩展的架构,适用于分类以外的多种医学影像任务。
提出的方法
- 为每个模态集成一个 CNN 分支(ResNet18/34/50/152)以进行局部特征提取。
- 使用 Vision Transformer(DeiT-Tiny/Small/Base)分支通过多头自注意力机制建模跨模态的长距离依赖关系。
- 通过可学习的融合模块在特征层面融合两个分支的特征,以实现跨模态交互。
- 采用基于图像块的序列化方法(使用不同块大小 K)将图像输入 Transformer 编码器。
- 使用标准交叉熵损失进行端到端训练,以实现多分类任务。
- 通过使用轻量级主干网络并避免在大规模数据集上进行全尺度预训练,优化计算效率。
实验结果
研究问题
- RQ1Transformer 是否能有效建模多模态医学图像中的长距离依赖关系,其中这些关系是显式且语义上有意义的?
- RQ2与现有的输入级、特征级和决策级融合策略相比,混合 CNN-Transformer 架构在多模态医学图像分类中的表现如何?
- RQ3不同块大小对 Vision Transformer 组件在医学图像分析中性能的影响是什么?
- RQ4在小规模医学影像数据集上,混合架构是否能超越纯 CNN 或纯 Transformer 模型?
- RQ5所提出方法在保持或提升准确率的同时,能在多大程度上降低计算成本?
主要发现
- TransMed-T 在腮腺肿瘤分类任务中达到 87.0% 的准确率,相比 P3D 方法平均准确率提升约 12.8%。
- 完整版 TransMed-B 和 TransMed-L 模型显示出轻微过拟合现象,表明在小数据集上泛化能力可能存在局限。
- 移除 Transformer 分支后准确率下降至 71.3%,证明其在以极小参数增加下建模跨模态关系的关键作用。
- 移除 CNN 分支导致性能急剧下降(准确率降至 51.3%),凸显在小样本场景下局部特征提取的重要性。
- 最优块大小为 K=2,准确率达到 87.0%;块大小过大(K≥8)导致性能下降,原因是语义信息丢失。
- TransMed 所用参数量(17M)和 FLOPs(0.09 TFLOPs)显著少于先前方法,展现出高效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。