Skip to main content
QUICK REVIEW

[论文解读] Is it Time to Replace CNNs with Transformers for Medical Images?

Christos Matsoukas, Johan Fredin Haslum|arXiv (Cornell University)|Aug 20, 2021
AI in cancer detection参考文献 23被引用 105
一句话总结

本文比较 vanilla CNNs 与视觉 Transformers (ViTs) 在医学影像中的表现,显示 ViTs 在预训练(ImageNet 或自监督)时能够达到或超过 CNN 的性能,并且通过注意力图提供更好的可解释性。

ABSTRACT

Convolutional Neural Networks (CNNs) have reigned for a decade as the de facto approach to automated medical image diagnosis. Recently, vision transformers (ViTs) have appeared as a competitive alternative to CNNs, yielding similar levels of performance while possessing several interesting properties that could prove beneficial for medical imaging tasks. In this work, we explore whether it is time to move to transformer-based models or if we should keep working with CNNs - can we trivially switch to transformers? If so, what are the advantages and drawbacks of switching to ViTs for medical image diagnosis? We consider these questions in a series of experiments on three mainstream medical image datasets. Our findings show that, while CNNs perform better when trained from scratch, off-the-shelf vision transformers using default hyperparameters are on par with CNNs when pretrained on ImageNet, and outperform their CNN counterparts when pretrained using self-supervision.

研究动机与目标

  • 评估现成的 ViTs 是否可以在不进行大幅 redesign 的前提下替代 CNNs 进行医学图像诊断。
  • 评估在不同初始化策略(随机、ImageNet 预训练、自监督预训练)下 CNN 与 ViTs 的性能。
  • 确定在自然图像中看到的迁移学习和自监督对医学影像的益处是否也适用于医学影像。
  • 分析 ViTs 通过注意力图带来的可解释性优势。

提出的方法

  • 将 ResNet50(CNN)与 DeiT-S(ViT)在 16x16 令牌下,三种初始化策略进行标准化比较。
  • 三个医学数据集:APTOS2019(糖尿病视网膜病变)、ISIC2019(皮肤病变)、CBIS-DDSM(乳腺X线摄影)。
  • 训练:Adam 优化器,基础学习率 1e-4,预热,学习率衰减,输入 256x256,常用数据增强。
  • 每种设置重复五次,选取最佳验证检查点。
  • 以 ImageNet 初始化后在目标数据上进行自监督预训练,随后进行有监督微调。

实验结果

研究问题

  • RQ1现成的 ViTs 是否可以在 modest 数据规模下作为 CNN 的即插即用替代在医学影像分析中?
  • RQ2ImageNet 预训练和自监督预训练是否有助于 ViTs 达到或超过医学任务的 CNN 水平或更好?
  • RQ3自监督预训练是否相对于 CNN 给 ViTs 带来更大优势在医学影像中?
  • RQ4相对于 CNN,在医学影像中 ViTs 的可解释性有哪些优势?

主要发现

  • 在数据有限时,ImageNet 预训练的 ViTs 的表现与 CNN 相当。
  • 以 ImageNet 初始化进行迁移学习有助于 ViTs 在医学任务上达到 CNN 的性能。
  • 自监督预训练加上有监督微调能达到最佳性能,在该 setting 下 ViTs 略微优于 CNN。
  • 随机初始化时,CNN 在所有数据集上优于 ViTs。
  • ViTs 通过注意力图提供更好的可解释性,比 Grad-CAM 提供的细粒度 saliency 更好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。