Skip to main content
QUICK REVIEW

[论文解读] COVID-CT-MD: COVID-19 Computed Tomography (CT) Scan Dataset Applicable in Machine Learning and Deep Learning

Parnian Afshar, Shahin Heidarian|arXiv (Cornell University)|Sep 28, 2020
COVID-19 diagnosis using AIMedicine参考文献 13被引用 19
一句话总结

本论文介绍了COVID-CT-MD,这是一个全面的CT扫描数据集,包含171例COVID-19、76例正常及60例社区获得性肺炎(CAP)病例,所有病例均具有患者级别、切片级别和肺叶级别标注。该数据集支持先进的机器学习与深度学习在COVID-19分类、定位与分割中的应用,提供完整的CT容积和多级标签,有助于提升诊断建模的准确性与模型可解释性。

ABSTRACT

Novel Coronavirus (COVID-19) has drastically overwhelmed more than 200 countries affecting millions and claiming almost 1 million lives, since its emergence in late 2019. This highly contagious disease can easily spread, and if not controlled in a timely fashion, can rapidly incapacitate healthcare systems. The current standard diagnosis method, the Reverse Transcription Polymerase Chain Reaction (RT- PCR), is time consuming, and subject to low sensitivity. Chest Radiograph (CXR), the first imaging modality to be used, is readily available and gives immediate results. However, it has notoriously lower sensitivity than Computed Tomography (CT), which can be used efficiently to complement other diagnostic methods. This paper introduces a new COVID-19 CT scan dataset, referred to as COVID-CT-MD, consisting of not only COVID-19 cases, but also healthy and subjects infected by Community Acquired Pneumonia (CAP). COVID-CT-MD dataset, which is accompanied with lobe-level, slice-level and patient-level labels, has the potential to facilitate the COVID-19 research, in particular COVID-CT-MD can assist in development of advanced Machine Learning (ML) and Deep Neural Network (DNN) based solutions.

研究动机与目标

  • 解决COVID-19研究中公开可用、多类别、多级标注CT数据集的缺乏问题。
  • 提供一个标准化的高质量数据集,包含完整的CT容积和详细标注,以支持稳健的机器学习与深度学习模型。
  • 促进能够实现感染在肺叶和切片级别定位的模型开发,从而提高诊断准确性和可解释性。
  • 支持COVID-19、CAP与正常病例之间的对比研究,以增强临床环境中的鉴别诊断能力。
  • 支持生成模型和数据增强技术的开发,以提升模型的泛化能力和鲁棒性。

提出的方法

  • 从伊朗德黑兰的Babak Imaging Center收集了307例CT扫描,涵盖确诊的COVID-19、正常及CAP病例。
  • 由三位经验丰富的放射科医生提供多级标注:患者级别(总体诊断)、切片级别(感染与非感染切片)和肺叶级别(特定肺叶受累情况)。
  • 将数据组织为结构化文件夹:按病例类型(COVID-19、CAP、正常)分类,再按患者ID组织,CT切片采用DICOM格式。
  • 将切片级别和肺叶级别标签存储在二值化NumPy数组中:'Slice-level-labels.npy'(二维)和'Lobe-level-labels.npy'(三维),其中肺叶索引映射到解剖区域。
  • 通过严格的纳入标准、扫描后1天内完成的扫描仪校准,以及每年一次的SIEMENS质量控制,确保数据质量,防止伪影产生。
  • 通过Figshare共享数据集,并附带元数据和用于统计分析与可视化的代码。

实验结果

研究问题

  • RQ1多类别、多级标注的CT数据集是否能提升机器学习模型在区分COVID-19、CAP和正常病例方面的性能?
  • RQ2切片级别和肺叶级别标注在多大程度上提升了CT扫描中COVID-19感染的定位与可解释性?
  • RQ3使用完整容积CT数据结合详细标注,在分类与分割任务中训练深度学习模型的效果如何?
  • RQ4在数据集中包含CAP病例是否能提升用于COVID-19诊断的模型的鲁棒性与泛化能力?
  • RQ5多级标注对生成合成数据增强的生成模型开发有何影响?

主要发现

  • COVID-CT-MD数据集包含171例确诊COVID-19、76例正常及60例CAP病例,所有病例均具有完整的CT容积和多级标注。
  • 该数据集是目前唯一公开可用的、提供COVID-19肺叶级别标注的数据资源,可实现对感染在解剖肺叶中的精确定位。
  • 切片级别和肺叶级别标签以二值化NumPy数组形式存储,肺叶索引定义为:0(LLL)、1(LUL)、2(RLL)、3(RML)、4(RUL)。
  • 数据集在严格的质量控制下收集,扫描仪校准在扫描后1天内完成,且每年进行一次SIEMENS质量检查,以防止伪影产生。
  • 该数据集已成功应用于两阶段胶囊网络模型(COVID-FACT),结合切片级别和患者级别标签,实现了准确的患者级别分类。
  • 该数据集可通过Figshare公开获取,并附带相关代码,支持可复现性及医学影像AI领域的进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。