Skip to main content
QUICK REVIEW

[论文解读] COVID-19 Detection in Chest X-ray Images Using Swin-Transformer and Transformer in Transformer

Juntao Jiang, Shu‐Yi Lin|arXiv (Cornell University)|Oct 16, 2021
COVID-19 diagnosis using AI参考文献 11被引用 8
一句话总结

本文提出了一种混合深度学习方法,结合Swin-Transformer与Transformer in Transformer(TNT),用于将胸部X光片分类为三种类别:COVID-19、肺炎和正常。通过加权集成平均两种模型,该方法在Chest XR COVID-19 Detection Challenge数据集上实现了0.9475的测试准确率,证明了在数据量有限和计算资源受限的情况下,视觉Transformer在医学图像分类中的有效性。

ABSTRACT

The Coronavirus Disease 2019 (COVID-19) has spread globally and caused serious damage. Chest X-ray images are widely used for COVID-19 diagnosis and the Artificial Intelligence method can increase efficiency and accuracy. In the Challenge of Chest XR COVID-19 detection in Ethics and Explainability for Responsible Data Science (EE-RDS) conference 2021, we proposed a method that combined Swin Transformer and Transformer in Transformer to classify chest X-ray images as three classes: COVID-19, Pneumonia, and Normal (healthy) and achieved 0.9475 accuracies on the test set.

研究动机与目标

  • 通过最先进的视觉Transformer架构,提升胸部X光片中COVID-19检测的准确率与效率。
  • 在标注数据有限的背景下,研究Swin-Transformer与Transformer in Transformer在医学图像分类中的表现。
  • 开发一种稳健、可解释且负责任的AI解决方案,用于通过X光成像实现COVID-19的早期检测。
  • 通过模型集成与细致的数据预处理,在Chest XR COVID-19 Detection Challenge基准上实现高性能。

提出的方法

  • 采用具有层次化特征图和移位窗口多头自注意力机制的Swin-Transformer(Swin-B),以建模胸部X光片中的局部与全局依赖关系。
  • 集成Transformer in Transformer(TNT-S),将图像块视为‘视觉句子’,并将其细分为‘视觉词汇’,以增强表征学习能力。
  • 应用数据增强技术,包括随机水平翻转、小范围旋转/平移以及低概率的随机擦除,以保留诊断特征。
  • 将图像调整为224×224用于Swin-Transformer,384×384用于TNT,以匹配预训练的ImageNet模型并控制计算负载。
  • 使用AdamW优化器、余弦退火学习率调度、标签平滑和0.05的权重衰减对两个模型进行训练。
  • 通过加权平均集成策略结合两个模型的预测结果,随后使用线性分类器进行最终类别预测。

实验结果

研究问题

  • RQ1在训练数据有限的情况下,Swin-Transformer与Transformer in Transformer能否有效将胸部X光片分类为COVID-19、肺炎和正常类别?
  • RQ2在Chest XR挑战数据集上,Swin-Transformer与TNT的集成模型相较于单个模型,在准确率与鲁棒性方面表现如何?
  • RQ3细致的数据预处理与增强在不导致过拟合的前提下,能在多大程度上保留医学X光片中的关键诊断特征?
  • RQ4输入分辨率与模型架构选择在低数据医学影像场景下的性能影响如何?
  • RQ5视觉Transformer能否在检测COVID-19 X光片中细微肺部模式方面超越传统的CNN-based模型?

主要发现

  • 集成模型在测试集上达到0.9475的准确率,在官方挑战排行榜上位列第10名。
  • 敏感度与特异性得分均超过0.94,表明在正确识别阳性与阴性病例方面表现强劲。
  • 采用Swin-Transformer与TNT 2:1权重比例的模型实现了最高准确率(0.9475),优于等权重及单个模型的结果。
  • Swin-Transformer模型单独实现0.9467的准确率,而TNT模型单独结果未报告,但对集成性能有显著贡献。
  • 采用最小化、非破坏性的数据增强策略,成功保留了对医学诊断至关重要的类别区分特征。
  • 尽管存在计算资源限制,该方法证明了视觉Transformer在低资源医学影像任务中仍可实现高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。