Skip to main content
QUICK REVIEW

[论文解读] COVIDx CT-3: A Large-scale, Multinational, Open-Source Benchmark Dataset for Computer-aided COVID-19 Screening from Chest CT Images

Hayden Gunraj, Tia Tuinstra|arXiv (Cornell University)|Jun 7, 2022
COVID-19 diagnosis using AI被引用 6
一句话总结

COVIDx CT-3 引入了一个大规模、跨国、开源的基准数据集,包含来自至少17个国家的6,068名患者的431,205张胸部CT切片,支持基于机器学习的COVID-19筛查。尽管规模庞大且具有多样性,该数据集仍显示出显著的地理和类别不平衡,其中42.2%的患者来自中国,73.4%的图像被标记为COVID-19,凸显了模型泛化过程中关键的数据偏差挑战。

ABSTRACT

Computed tomography (CT) has been widely explored as a COVID-19 screening and assessment tool to complement RT-PCR testing. To assist radiologists with CT-based COVID-19 screening, a number of computer-aided systems have been proposed. However, many proposed systems are built using CT data which is limited in both quantity and diversity. Motivated to support efforts in the development of machine learning-driven screening systems, we introduce COVIDx CT-3, a large-scale multinational benchmark dataset for detection of COVID-19 cases from chest CT images. COVIDx CT-3 includes 431,205 CT slices from 6,068 patients across at least 17 countries, which to the best of our knowledge represents the largest, most diverse dataset of COVID-19 CT images in open-access form. Additionally, we examine the data diversity and potential biases of the COVIDx CT-3 dataset, finding that significant geographic and class imbalances remain despite efforts to curate data from a wide variety of sources.

研究动机与目标

  • 解决在训练和评估用于COVID-19筛查的机器学习模型时,缺乏大规模、多样化且可公开访问的CT数据集的问题。
  • 克服以往研究依赖单一国家队列或小规模、非代表性数据集的局限性。
  • 提供一个基准数据集,以加速从胸部CT图像中开发可泛化的计算机辅助COVID-19检测系统。
  • 调查并量化大规模、跨国医学影像数据集中存在的数据多样性与潜在偏差,以指导未来的数据整理工作。
  • 通过发布标准化、经过良好整理的数据集,明确的标注协议和数据溯源信息,支持可复现的研究。

提出的方法

  • 从11个国际来源(包括CNCB、NIH ITAC、COVID-CT-MD、LIDC-IDRI和Radiopaedia)汇聚CT图像,以确保广泛的地理和扫描协议多样性。
  • 采用三种标注策略:基于分割的标注(使用真实感染掩膜)、非专家手动标注(用于明显异常)以及基于预训练模型的自动标注。
  • 在患者层面为所有切片分配标签,确保数据集内的一致性,最终标签基于患者诊断结果:COVID-19、CAP或正常。
  • 将数据集划分为训练集(84%)、验证集(8%)和测试集(8%),并保留专家标注的标签用于验证集和测试集,以确保可靠性。
  • 实施严格的数据整理流程,仅包含高质量、匿名化且去标识化的CT切片,并附有经确认的临床诊断。
  • 对人口统计分布、地理来源、年龄、性别以及类别不平衡进行全面分析,以评估数据集的偏差和代表性。

实验结果

研究问题

  • RQ1COVIDx CT-3数据集在患者地理分布、年龄和性别方面在多大程度上反映了全球多样性?
  • RQ2类别不平衡(尤其是COVID-19、CAP和正常病例)在多大程度上影响了在此数据集上训练的机器学习模型的性能和公平性?
  • RQ3大规模、开放获取的医学影像数据集中主要的偏差来源是什么,它们如何影响模型的泛化能力?
  • RQ4像COVIDx CT-3这样大规模、跨国的数据集能否作为训练和评估AI模型在COVID-19筛查中应用的可靠基准?
  • RQ5非专家和自动标注的引入在多大程度上影响了该数据集在研究目的下的可靠性与实用性?

主要发现

  • COVIDx CT-3 包含来自至少17个国家的6,068名患者的431,205张CT切片,是同类中规模最大的开源数据集。
  • 中国占患者队列的42.2%,且85.9%的患者仅在四个国家(中国、法国、俄罗斯、伊朗)进行扫描,表明存在强烈的地理偏差。
  • 超过一半(51.4%)的患者年龄未知,仅有45.9%的已知年龄患者处于30–89岁范围,表明年轻和高龄患者代表性不足。
  • 该数据集存在显著的类别不平衡:73.4%的图像被标记为COVID-19,16.6%为CAP,10.0%为正常,主要集中在训练集。
  • 尽管努力纳入多样化来源,验证集和测试集仍保持约2.2:1:1的COVID-19、CAP和正常病例比例,更具平衡性。
  • 本研究识别出在数据多样性和偏差方面持续存在的挑战,呼吁研究人员在训练和评估用于临床部署的AI模型时充分考虑这些局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。