[论文解读] Visual Transformer with Statistical Test for COVID-19 Classification
本文提出了一种用于从胸部CT扫描中进行COVID-19分类的2D和3D深度学习框架,即DWCC和CCAT。DWCC使用深度Wilcoxon符号秩检验自动识别最具信息量的CT切片,而CCAT则采用卷积CT扫描感知Transformer,结合片内和片间Transformer以建模空间和时间上下文。该方法实现了94.1%的准确率,显著优于当前最先进模型。
With the massive damage in the world caused by Coronavirus Disease 2019 SARS-CoV-2 (COVID-19), many related research topics have been proposed in the past two years. The Chest Computed Tomography (CT) scans are the most valuable materials to diagnose the COVID-19 symptoms. However, most schemes for COVID-19 classification of Chest CT scan is based on a single-slice level, implying that the most critical CT slice should be selected from the original CT scan volume manually. We simultaneously propose 2-D and 3-D models to predict the COVID-19 of CT scan to tickle this issue. In our 2-D model, we introduce the Deep Wilcoxon signed-rank test (DWCC) to determine the importance of each slice of a CT scan to overcome the issue mentioned previously. Furthermore, a Convolutional CT scan-Aware Transformer (CCAT) is proposed to discover the context of the slices fully. The frame-level feature is extracted from each CT slice based on any backbone network and followed by feeding the features to our within-slice-Transformer (WST) to discover the context information in the pixel dimension. The proposed Between-Slice-Transformer (BST) is used to aggregate the extracted spatial-context features of every CT slice. A simple classifier is then used to judge whether the Spatio-temporal features are COVID-19 or non-COVID-19. The extensive experiments demonstrated that the proposed CCAT and DWCC significantly outperform the state-of-the-art methods.
研究动机与目标
- 为解决单切片CT分类方法依赖人工选择关键切片且无法捕捉3D上下文的局限性。
- 在医学影像中常见于罕见疾病(如COVID-19)的低数据环境下,减少过拟合并提升泛化能力。
- 开发一种计算效率高但性能强大的3D模型,利用CT体积中的空间(像素级)和时间(切片级)上下文。
- 通过将非参数统计推断(Wilcoxon检验)整合到深度学习中,实现切片重要性排序,从而提升模型可解释性。
- 在COV19-CT-DB数据集上,超越现有最先进方法,在准确率、精确率、召回率和F1分数上表现更优。
提出的方法
- DWCC应用深度Wilcoxon符号秩检验,根据其在检测COVID-19中的统计显著性对CT切片进行排序,实现无需人工干预的最具信息量切片的自动选择。
- CCAT采用双分支Transformer架构:片内Transformer(WST)捕捉每一切片内的像素级上下文,片间Transformer(BST)建模3D体积中切片间的相互关系。
- 模型使用ResNet-50主干网络从每张CT切片中提取初始特征,随后通过WST和BST进行特征处理,实现时空表征学习。
- 采用固定16张切片作为输入,采样频率为2,并在训练过程中应用数据增强(模糊、噪声、对比度、亮度、光学畸变)。
- 对整个3D体积应用随机裁剪和旋转,而非单个切片,以保持切片级上下文完整。
- 通过DWCC与CCAT之间的多数投票模型集成,进一步提升性能,达到最高的评估指标。
实验结果
研究问题
- RQ1非参数统计检验(如Wilcoxon符号秩检验)能否有效集成到深度学习中,以提升CT扫描中切片级重要性排序的可解释性与稳定性?
- RQ2混合CNN-Transformer架构能否有效建模3D CT体积中的像素级与切片级上下文,从而提升COVID-19分类性能?
- RQ3所提出的CCAT模型是否在COV19-CT-DB数据集上,特别是在低数据环境下,优于现有的2D与3D基线模型?
- RQ4注意力头数量和输入切片数量等超参数如何影响CCAT模型的性能与泛化能力?
- RQ5将统计推断与深度学习相结合,能否在小样本医学影像数据集中减少过拟合并提升模型鲁棒性?
主要发现
- 所提出的DWCC模型实现了91.9%的准确率、93.1%的精确率、91.1%的召回率和91.7%的F1分数,显著优于基线[8]及其他最先进模型。
- CCAT模型实现了93.3%的准确率、93.5%的精确率、92.9%的召回率和93.2%的F1分数,展现出对现有2D与3D方法的优越性能。
- DWCC与CCAT的模型集成实现了最高性能,准确率达到94.1%,精确率为94.7%,召回率为93.5%,F1分数为93.9%,表明两者具有互补优势。
- 超参数调优显示,在输入16张切片且注意力头数为0(等价于gMLP)时达到最优性能,所有指标的训练曲线均稳定且平滑。
- 可视化结果证实,该模型即使仅依赖CT扫描级标注,也能准确定位关键病理区域,表明其可解释性得到显著提升。
- 该方法在低数据环境下有效缓解了过拟合问题,减少了对专家标注关键切片的依赖,实现了完全自动化且可靠的分类。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。