[论文解读] CheXpert Plus: Augmenting a Large Chest X-ray Dataset with Text Radiology Reports, Patient Demographics and Additional Image Formats
CheXpert Plus 通过整合去识别化的放射科报告、患者人口统计信息、病理学标签、RadGraph 标注以及多格式图像(DICOM 和 PNG),显著增强了 CheXpert 胸部 X 光数据集,支持大规模、公平且稳健的放射科人工智能研究。该数据集包含 3600 万个文本标记、100 万个去识别化的 PHI 段,并支持跨机构训练,模型与数据已公开发布,供非商业研究使用。
Since the release of the original CheXpert paper five years ago, CheXpert has become one of the most widely used and cited clinical AI datasets. The emergence of vision language models has sparked an increase in demands for sharing reports linked to CheXpert images, along with a growing interest among AI fairness researchers in obtaining demographic data. To address this, CheXpert Plus serves as a new collection of radiology data sources, made publicly available to enhance the scaling, performance, robustness, and fairness of models for all subsequent machine learning tasks in the field of radiology. CheXpert Plus is the largest text dataset publicly released in radiology, with a total of 36 million text tokens, including 13 million impression tokens. To the best of our knowledge, it represents the largest text de-identification effort in radiology, with almost 1 million PHI spans anonymized. It is only the second time that a large-scale English paired dataset has been released in radiology, thereby enabling, for the first time, cross-institution training at scale. All reports are paired with high-quality images in DICOM format, along with numerous image and patient metadata covering various clinical and socio-economic groups, as well as many pathology labels and RadGraph annotations. We hope this dataset will boost research for AI models that can further assist radiologists and help improve medical care. Data is available at the following URL: https://stanfordaimi.azurewebsites.net/datasets/5158c524-d3ab-4e02-96e9-6ee9efc110a1 Models are available at the following URL: https://github.com/Stanford-AIMI/chexpert-plus
研究动机与目标
- 为应对放射科人工智能中对配对图像-文本数据日益增长的需求,通过整合放射科报告和患者人口统计信息来扩充 CheXpert 数据集。
- 通过发布一个大规模、英文、多源数据集,实现跨机构训练,提升模型的鲁棒性。
- 通过包含临床和经济社会人口统计信息,支持公平性研究,减轻人工智能模型中的偏见。
- 通过提供预标注的 RadGraph 和病理学标签,简化下游任务(如报告生成和分类)的处理。
- 发布一套在扩充数据上训练的完整模型,涵盖关键放射科任务,包括图文生成和文本到文本生成。
提出的方法
- 通过从原始 CheXpert 数据集收集并配对高质量的 DICOM 和 PNG 图像,构建了该数据集。
- 将报告解析为子部分(如“发现”和“印象”),并采用结合基于规则的 NLP 和大语言模型(LLM)的混合管道进行去识别化,随后由一名获得认证的放射科医生进行人工审核。
- 整合了包括性别、种族、年龄和保险状态在内的患者人口统计信息,以支持公平性和偏见分析。
- 利用自然语言处理技术自动从报告中提取病理学标签,并为“发现”和“印象”部分计算 RadGraph 标注。
- 采用严格的四步去识别化流程,确保所有 100 万个 PHI 段均被替换为合成等效项,同时保持报告结构和语义不变。
- 该数据集以仅限研究使用的协议发布,基于该数据训练的模型也已公开,可用于报告生成、摘要生成和分类等任务。
实验结果
研究问题
- RQ1大规模、去识别化、多源的放射科数据集在多大程度上能提升视觉-语言模型在胸部 X 光分析中的性能与鲁棒性?
- RQ2在放射科数据集中纳入人口统计和经济社会数据,能在多大程度上减少人工智能模型预测中的偏见?
- RQ3在多种格式(DICOM 和 PNG)下同时提供配对的报告与图像,是否能有效支持跨机构训练并提升模型的泛化能力?
- RQ4混合使用自动化处理与人工审核的去识别化流程,在确保患者隐私的同时,能否有效保持数据的实用性?
- RQ5RadGraph 结构化标注的引入,对报告生成和医学概念提取等下游任务有何影响?
主要发现
- CheXpert Plus 是目前放射科领域最大规模的公开文本数据集,包含 3600 万个文本标记(其中 1300 万个为印象部分标记),也是首个以规模化方式包含去识别化报告的数据集。
- 该数据集包含近 100 万个去识别化的 PHI 段,是迄今为止放射科领域最大规模的去识别化工作,其混合自动化与人工审核的流程确保了隐私安全。
- 它仅是第二个大规模英文配对图像-文本放射科数据集,支持跨机构训练,提升了在多样化临床环境中的模型鲁棒性。
- 该数据集提供 14 个自动提取的病理学标签,以及为“发现”和“印象”部分预计算的 RadGraph 标注,显著简化了下游自然语言处理与视觉-语言任务的处理。
- 去识别化流程成功将所有真实 PHI 段替换为合成版本,最终验证阶段仅遗漏了 0.01% 的 PHI 段,且多为部分遗漏。
- 此次发布包含一套用于关键放射科任务的预训练模型,如图文生成和文本摘要,显著加速了医学人工智能的研究进程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。