Skip to main content
QUICK REVIEW

[论文解读] Intra-model Variability in COVID-19 Classification Using Chest X-ray Images

Brian D. Goodwin, Corey Jaskolski|arXiv (Cornell University)|Apr 30, 2020
COVID-19 diagnosis using AI参考文献 30被引用 9
一句话总结

本研究通过在12种深度学习架构上使用胸部X光片评估COVID-19分类的模型内变异性,对每种模型使用相同的训练-验证-测试数据划分进行五次训练,以隔离权重初始化、数据增强和批量打乱等因素带来的影响。表现最佳的模型在保留的测试集上达到了15%的假阴性率(3/20),表明尽管模型架构和数据完全相同,性能仍存在显著不一致性,凸显了构建更大、更多样化数据集以提升临床可靠性的迫切需求。

ABSTRACT

X-ray and computed tomography (CT) scanning technologies for COVID-19 screening have gained significant traction in AI research since the start of the coronavirus pandemic. Despite these continuous advancements for COVID-19 screening, many concerns remain about model reliability when used in a clinical setting. Much has been published, but with limited transparency in expected model performance. We set out to address this limitation through a set of experiments to quantify baseline performance metrics and variability for COVID-19 detection in chest x-ray for 12 common deep learning architectures. Specifically, we adopted an experimental paradigm controlling for train-validation-test split and model architecture where the source of prediction variability originates from model weight initialization, random data augmentation transformations, and batch shuffling. Each model architecture was trained 5 separate times on identical train-validation-test splits of a publicly available x-ray image dataset provided by Cohen et al. (2020). Results indicate that even within model architectures, model behavior varies in a meaningful way between trained models. Best performing models achieve a false negative rate of 3 out of 20 for detecting COVID-19 in a hold-out set. While these results show promise in using AI for COVID-19 screening, they further support the urgent need for diverse medical imaging datasets for model training in a way that yields consistent prediction outcomes. It is our hope that these modeling results accelerate work in building a more robust dataset and a viable screening tool for COVID-19.

研究动机与目标

  • 量化在模型架构和数据划分完全相同的情况下,基于胸部X光片进行COVID-19检测的模型性能变异性。
  • 评估随机因素(权重初始化、数据增强和批量打乱)对预测可靠性的影响。
  • 在公开的胸部X光片数据集上,评估12种常见深度学习架构的基线性能指标。
  • 发布预训练模型权重和训练代码,以加速社区研究并提高模型训练效率。
  • 揭示当前数据集的局限性,并倡导采用更大、更多样化的数据以实现临床可用的AI筛查工具。

提出的方法

  • 所有实验均采用固定的80-10-10训练-验证-测试划分,以隔离数据划分带来的影响。
  • 对12种深度学习架构中的每一种均进行五次训练,使用相同的训练数据划分但不同的随机种子,以改变权重初始化、数据增强和批量打乱方式。
  • 实验在Lambda Labs GPU硬件上使用PyTorch完成,模型性能在保留的测试集上进行评估。
  • 主要数据来源为Cohen等人(2020)发布的公开胸部X光片数据集,包含健康、社区获得性肺炎和COVID-19三类。
  • 性能通过标准指标(包括准确率、精确率、召回率和假阴性率(FNR))进行衡量,重点关注FNR因临床意义。
  • 预训练模型权重和训练代码以知识共享署名-非商业性使用4.0国际许可发布,以支持社区研究。

实验结果

研究问题

  • RQ1在相同的胸部X光片数据集上,同一深度学习架构的多次训练运行之间,预测性能的变异性有多大?
  • RQ2当模型架构和数据划分保持不变时,COVID-19分类模型性能差异的主要来源是什么?
  • RQ3在公开可用的胸部X光片数据上,使用当前深度学习模型进行COVID-19检测,可实现的最低假阴性率是多少?
  • RQ4在相同数据上训练且随机性受控的情况下,不同深度学习架构的性能指标如何变化?
  • RQ5当前公开数据集在多大程度上限制了AI模型在临床COVID-19筛查中的可靠性和一致性?

主要发现

  • 表现最佳的模型在保留的测试集上达到了15%的假阴性率(3/20),表明检测性能虽有一定意义但仍未达到理想水平。
  • 即使在模型架构和数据划分完全相同的情况下,仍观察到显著的模型内变异性,多次训练运行之间的性能存在明显差异。
  • 研究发现,权重初始化、数据增强和批量打乱是导致预测变异性的重要因素,严重削弱了模型的一致性。
  • 尽管某些训练运行中性能表现优异,但总体结果表明,当前模型因在相同架构下行为不一致,仍不适合临床部署。
  • 研究结果强调,当前模型可靠性受限于数据集的局限性,而非架构设计,因此需要更大、更多样化的数据集以实现一致结果。
  • 作者发布了预训练权重和训练代码,以加速研究进程并提高训练效率,旨在支持开发更稳健的筛查工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。