[论文解读] Intra-model Variability in COVID-19 Classification Using Chest X-ray Images
本研究通过在12种深度学习架构上使用胸部X光片评估COVID-19分类的模型内变异性,对每种模型使用相同的训练-验证-测试数据划分进行五次训练,以隔离权重初始化、数据增强和批量打乱等因素带来的影响。表现最佳的模型在保留的测试集上达到了15%的假阴性率(3/20),表明尽管模型架构和数据完全相同,性能仍存在显著不一致性,凸显了构建更大、更多样化数据集以提升临床可靠性的迫切需求。
X-ray and computed tomography (CT) scanning technologies for COVID-19 screening have gained significant traction in AI research since the start of the coronavirus pandemic. Despite these continuous advancements for COVID-19 screening, many concerns remain about model reliability when used in a clinical setting. Much has been published, but with limited transparency in expected model performance. We set out to address this limitation through a set of experiments to quantify baseline performance metrics and variability for COVID-19 detection in chest x-ray for 12 common deep learning architectures. Specifically, we adopted an experimental paradigm controlling for train-validation-test split and model architecture where the source of prediction variability originates from model weight initialization, random data augmentation transformations, and batch shuffling. Each model architecture was trained 5 separate times on identical train-validation-test splits of a publicly available x-ray image dataset provided by Cohen et al. (2020). Results indicate that even within model architectures, model behavior varies in a meaningful way between trained models. Best performing models achieve a false negative rate of 3 out of 20 for detecting COVID-19 in a hold-out set. While these results show promise in using AI for COVID-19 screening, they further support the urgent need for diverse medical imaging datasets for model training in a way that yields consistent prediction outcomes. It is our hope that these modeling results accelerate work in building a more robust dataset and a viable screening tool for COVID-19.
研究动机与目标
- 量化在模型架构和数据划分完全相同的情况下,基于胸部X光片进行COVID-19检测的模型性能变异性。
- 评估随机因素(权重初始化、数据增强和批量打乱)对预测可靠性的影响。
- 在公开的胸部X光片数据集上,评估12种常见深度学习架构的基线性能指标。
- 发布预训练模型权重和训练代码,以加速社区研究并提高模型训练效率。
- 揭示当前数据集的局限性,并倡导采用更大、更多样化的数据以实现临床可用的AI筛查工具。
提出的方法
- 所有实验均采用固定的80-10-10训练-验证-测试划分,以隔离数据划分带来的影响。
- 对12种深度学习架构中的每一种均进行五次训练,使用相同的训练数据划分但不同的随机种子,以改变权重初始化、数据增强和批量打乱方式。
- 实验在Lambda Labs GPU硬件上使用PyTorch完成,模型性能在保留的测试集上进行评估。
- 主要数据来源为Cohen等人(2020)发布的公开胸部X光片数据集,包含健康、社区获得性肺炎和COVID-19三类。
- 性能通过标准指标(包括准确率、精确率、召回率和假阴性率(FNR))进行衡量,重点关注FNR因临床意义。
- 预训练模型权重和训练代码以知识共享署名-非商业性使用4.0国际许可发布,以支持社区研究。
实验结果
研究问题
- RQ1在相同的胸部X光片数据集上,同一深度学习架构的多次训练运行之间,预测性能的变异性有多大?
- RQ2当模型架构和数据划分保持不变时,COVID-19分类模型性能差异的主要来源是什么?
- RQ3在公开可用的胸部X光片数据上,使用当前深度学习模型进行COVID-19检测,可实现的最低假阴性率是多少?
- RQ4在相同数据上训练且随机性受控的情况下,不同深度学习架构的性能指标如何变化?
- RQ5当前公开数据集在多大程度上限制了AI模型在临床COVID-19筛查中的可靠性和一致性?
主要发现
- 表现最佳的模型在保留的测试集上达到了15%的假阴性率(3/20),表明检测性能虽有一定意义但仍未达到理想水平。
- 即使在模型架构和数据划分完全相同的情况下,仍观察到显著的模型内变异性,多次训练运行之间的性能存在明显差异。
- 研究发现,权重初始化、数据增强和批量打乱是导致预测变异性的重要因素,严重削弱了模型的一致性。
- 尽管某些训练运行中性能表现优异,但总体结果表明,当前模型因在相同架构下行为不一致,仍不适合临床部署。
- 研究结果强调,当前模型可靠性受限于数据集的局限性,而非架构设计,因此需要更大、更多样化的数据集以实现一致结果。
- 作者发布了预训练权重和训练代码,以加速研究进程并提高训练效率,旨在支持开发更稳健的筛查工具。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。