Skip to main content
QUICK REVIEW

[论文解读] Vision Transformer for Classification of Breast Ultrasound Images

Behnaz Gheflati, Hassan Rivaz|arXiv (Cornell University)|Oct 27, 2021
AI in cancer detection参考文献 18被引用 4
一句话总结

本研究将视觉变换器(ViT)应用于乳腺超声(US)图像分类,利用预训练ViT模型的迁移学习方法以应对医疗数据集规模有限的问题。结果表明,ViT模型在准确率(86.7%)和曲线下面积(AUC,0.95)方面达到与最先进卷积神经网络(CNN)相当或更优的性能,证明了自注意力机制在捕捉US图像中全局解剖依赖关系方面的有效性。

ABSTRACT

Medical ultrasound (US) imaging has become a prominent modality for breast cancer imaging due to its ease-of-use, low-cost and safety. In the past decade, convolutional neural networks (CNNs) have emerged as the method of choice in vision applications and have shown excellent potential in automatic classification of US images. Despite their success, their restricted local receptive field limits their ability to learn global context information. Recently, Vision Transformer (ViT) designs that are based on self-attention between image patches have shown great potential to be an alternative to CNNs. In this study, for the first time, we utilize ViT to classify breast US images using different augmentation strategies. The results are provided as classification accuracy and Area Under the Curve (AUC) metrics, and the performance is compared with the state-of-the-art CNNs. The results indicate that the ViT models have comparable efficiency with or even better than the CNNs in classification of US breast images.

研究动机与目标

  • 探究视觉变换器(ViT)在自动分类乳腺超声(US)图像中的可行性。
  • 评估在有限医疗US数据集上,使用迁移学习的预训练ViT模型的性能。
  • 从分类准确率和AUC两个方面,对比ViT模型与最先进CNN模型的性能。
  • 分析数据增强和数据集规模对ViT在US图像分类中性能的影响。
  • 确定在低数据环境下实现高效微调的最优ViT架构。

提出的方法

  • 采用不同尺寸的预训练视觉变换器(ViT)模型(如B/32、S/32、R/16)在乳腺US图像数据集上通过迁移学习进行微调。
  • 图像被分割为图像块并进行嵌入,使用分类标记进行分类,遵循标准ViT架构。
  • 应用了包括轻量裁剪、旋转、亮度和对比度调整在内的数据增强技术,以提升泛化能力。
  • 通过在多个数据集(BUSI、B和BUSI+B)上的分类准确率和曲线下面积(AUC)指标评估性能。
  • 在BUSI+B数据集上进行微调,该数据集结合了BUSI和B数据集,以增强模型泛化能力。
  • 与最先进CNN模型(ResNet、VGG、Inception、NASNet)在相同迁移学习协议下进行对比实验。

实验结果

研究问题

  • RQ1视觉变换器在分类乳腺超声图像方面能否实现与最先进CNN模型相当或更优的性能?
  • RQ2数据增强对小样本医疗US图像数据集中微调后的ViT模型性能有何影响?
  • RQ3将多个数据集(如BUSI + B)合并对ViT模型泛化能力和性能有何影响?
  • RQ4哪种ViT架构(如B/32、S/32)在乳腺US图像分类中实现了性能与计算效率的最佳平衡?
  • RQ5ViT模型是否能有效学习到乳腺US图像中的长程空间依赖关系,即使在训练数据有限的情况下?

主要发现

  • ViT-B/32模型在BUSI+B数据集上实现了86.7%的最高分类准确率和0.95的AUC,优于其他ViT和CNN架构。
  • ViT模型在性能上与最先进CNN模型相当或更优,尤其在VGG、Inception和NASNet等小型模型上表现更佳。
  • 数据增强技术未提升ViT性能,表明其对US图像特定物理特征的收益有限。
  • 将BUSI和B数据集合并为BUSI+B显著提升了模型性能,B/32模型在该合并数据集上达到86.7%的准确率和0.95的AUC。
  • 较小的ViT模型(如B/32)与较大模型(如S/32、R/16)性能几乎相同,表明其具有高效率和低计算成本。
  • 不同ViT架构间性能的一致性表明,较小模型更适合微调,因其训练时间更短且资源消耗更低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。