Skip to main content
QUICK REVIEW

[论文解读] Caveats in Generating Medical Imaging Labels from Radiology Reports

Tobi Olatunji, Yao Li|arXiv (Cornell University)|May 6, 2019
COVID-19 diagnosis using AI参考文献 7被引用 8
一句话总结

本研究揭示了放射科医生对胸部X光片的视觉解读与其临床报告之间存在关键差异,表明常用于训练医疗AI的基于报告的标签因包含临床无关的发现而存在显著噪声。即使使用最先进的NLP模型在这些有缺陷的报告上进行训练,其对图像验证发现的识别率也仅达55.6%,严重削弱了模型的可靠性,凸显了在医疗AI中改进标注流程的必要性。

ABSTRACT

Acquiring high-quality annotations in medical imaging is usually a costly process. Automatic label extraction with natural language processing (NLP) has emerged as a promising workaround to bypass the need of expert annotation. Despite the convenience, the limitation of such an approximation has not been carefully examined and is not well understood. With a challenging set of 1,000 chest X-ray studies and their corresponding radiology reports, we show that there exists a surprisingly large discrepancy between what radiologists visually perceive and what they clinically report. Furthermore, with inherently flawed report as ground truth, the state-of-the-art medical NLP fails to produce high-fidelity labels.

研究动机与目标

  • 调查放射科医生对胸部X光片的视觉解读与临床报告之间的差距。
  • 评估NLP模型在报告本身存在误差时,从放射科报告中提取标签的可靠性。
  • 识别医学影像标注差异的根本原因,特别是常被忽略的非行动性发现。
  • 证明基于报告的标签本质上存在缺陷,导致以之为训练数据的下游AI模型性能低下。
  • 倡导重新评估将放射科报告作为医疗AI开发中真实标签的使用方式。

提出的方法

  • 整理了1,000份非筛查性胸部X光检查的影像与报告数据集。
  • 安排两组专家放射科医生独立标注:一组仅基于影像阅片($y_{\text{img}}^{\text{rad}}$),另一组仅基于报告阅片($y_{\text{txt}}^{\text{rad}}$)。
  • 使用最先进的医学NLP模型(Irvin et al., 2019)从报告中提取标签($y_{\text{txt}}^{\text{nlp}}$)。
  • 通过精确率、召回率和F1分数量化基于影像的标签与基于报告的标签之间的一致性。
  • 对不一致案例进行故障分析,将原因分类为非行动性发现、临界/细微发现、解剖变异、技术问题以及明显错误。
  • 将NLP提取的标签与放射科医生报告的标签进行比较,评估在现实世界数据质量限制下的NLP性能。

实验结果

研究问题

  • RQ1放射科医生对胸部X光片的视觉解读与临床报告之间存在多大程度的不一致?
  • RQ2非行动性发现对放射科报告中标签差异的贡献程度如何?
  • RQ3当NLP模型在包含临床无关或遗漏发现的放射科报告上进行训练时,其表现如何?
  • RQ4报告标注中的主要错误来源是什么,它们如何影响下游AI模型的性能?
  • RQ5当真实标签(即放射科报告)与视觉发现本身存在内在不一致时,NLP模型能否可靠地提取准确标签?

主要发现

  • 在全局异常(Global Abnormal)类别中,基于影像的标签与基于报告的标签之间的一致性仅为69%,为所有发现中最高。
  • 当使用报告标签作为真实标签时,NLP模型仅能识别出55.6%的图像验证发现,表明性能存在显著下降。
  • 对于心脏扩大(Cardiomegaly),NLP与报告标签之间的F1分数仅为0.23,反映出因报告不一致导致的严重对齐偏差。
  • 24%的报告将病例标记为正常,但影像阅片发现存在异常——表明存在严重的发现漏报。
  • 20%的报告标记为异常的病例在影像上实际为正常——凸显了过度报告和假阳性问题。
  • 不一致的主要原因是非行动性发现(如医疗设备、慢性改变和与年龄相关的发现)在放射科报告中被遗漏。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。