Skip to main content
QUICK REVIEW

[论文解读] Pretrained ViTs Yield Versatile Representations For Medical Images

C. Matsoukas, Johan Fredin Haslum|arXiv (Cornell University)|Mar 13, 2023
AI in cancer detection被引用 7
一句话总结

该论文表明,基于 ImageNet 预训练的视觉变换器(ViTs)在多个 2D 医疗图像分类基准上实现了与卷积神经网络(CNNs)相当的性能。在微调至医疗数据集时,现成的 ViTs 表现与 CNNs 相当或略胜一筹,尤其是在采用自监督预训练时,同时通过注意力图实现了更好的可解释性,并减少了对归纳偏置的依赖。

ABSTRACT

Convolutional Neural Networks (CNNs) have reigned for a decade as the de facto approach to automated medical image diagnosis, pushing the state-of-the-art in classification, detection and segmentation tasks. Over the last years, vision transformers (ViTs) have appeared as a competitive alternative to CNNs, yielding impressive levels of performance in the natural image domain, while possessing several interesting properties that could prove beneficial for medical imaging tasks. In this work, we explore the benefits and drawbacks of transformer-based models for medical image classification. We conduct a series of experiments on several standard 2D medical image benchmark datasets and tasks. Our findings show that, while CNNs perform better if trained from scratch, off-the-shelf vision transformers can perform on par with CNNs when pretrained on ImageNet, both in a supervised and self-supervised setting, rendering them as a viable alternative to CNNs.

研究动机与目标

  • 评估视觉变换器(ViTs)在医疗图像分类中是否可作为 CNNs 的可行替代方案。
  • 评估在 ImageNet 上预训练以及自监督预训练对 ViT 在多样化医疗影像任务中性能的影响。
  • 探究在医疗场景下,ViTs 相较于 CNNs 在可解释性和特征学习方面是否具有优势。
  • 确定 ViTs 在医疗影像设置中,随着模型容量和数据量增加时是否具备良好的可扩展性。
  • 比较 ViTs 与 CNNs 在医疗图像分析中的注意力模式,特别是病灶定位方面。

提出的方法

  • 在六个公开的 2D 医疗图像基准数据集上微调 DeiT-Small 和 DeiT-Base ViT 架构:ISIC 2019、APTOS 2019、PatchCamelyon、CheXpert、CBIS-DDSM 及其他数据集。
  • 在相同的训练协议下,将 ViT 性能与 ResNet-50 进行对比,包括监督预训练和自监督预训练设置。
  • 使用 MoCo v2 和 BYOL 在医疗图像数据上进行自监督预训练,以评估领域特定的表征学习能力。
  • 利用 Grad-CAM 和类别标记注意力图可视化并比较 ViTs 与 CNNs 的模型可解释性。
  • 通过消融研究分析补丁大小、模型容量和注意力模式对性能的影响,以评估架构设计的影响。
  • 在不同数据设置下评估 ViT 性能,包括少样本和全监督设置,以评估数据效率。

实验结果

研究问题

  • RQ1当在 ImageNet 上预训练时,视觉变换器(ViTs)是否能在 2D 医疗图像分类中实现与 CNNs 相当的性能?
  • RQ2在医疗数据上进行自监督预训练是否能进一步提升 ViTs 的性能,使其超越仅在 ImageNet 上预训练的性能?
  • RQ3ViTs 的注意力图与 CNN 的激活图在定位医疗图像中的病灶方面有何差异?
  • RQ4ViTs 在迁移学习方面相较于从零开始训练的收益有多大?与 CNNs 相比如何?
  • RQ5在医疗影像任务中,ViTs 是否在模型大小和数据量增加时表现出优于 CNNs 的可扩展性?

主要发现

  • 在 ISIC 2019、APTOS 2019、PatchCamelyon、CheXpert 和 CBIS-DDSM 等所有评估的医疗图像分类基准上,基于 ImageNet 预训练的 ViTs 表现与 ResNet-50 相当。
  • 从零开始训练时,CNNs 表现优于 ViTs,但 ViTs 在 ImageNet 预训练下获得的性能提升幅度显著高于 CNNs。
  • 在医疗数据上进行自监督预训练可为 ViTs 带来微小但一致的性能优势,尤其在结合 ImageNet 预训练时更为明显。
  • 与 CNNs 相比,ViTs 生成的注意力图更具局部化和可解释性,能清晰聚焦于皮肤病变、出血灶和 X 光片中的不透明区域等病灶。
  • ViTs 从早期层即开始关注图像的全局和局部区域,表明长距离依赖关系在早期即被捕捉,而 CNNs 则依赖更深的层来获取全局上下文。
  • ViT 的性能随模型容量增加和补丁尺寸减小而与 CNNs 同样良好地提升,且在减少归纳偏置的情况下仍能保持强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。