[论文解读] Caveats in Generating Medical Imaging Labels from Radiology Reports
本研究揭示了放射科医生对胸部X光片的视觉解读与其临床报告之间存在关键差异,表明常用于训练医疗AI的基于报告的标签因包含临床无关的发现而存在显著噪声。即使使用最先进的NLP模型在这些有缺陷的报告上进行训练,其对图像验证发现的识别率也仅达55.6%,严重削弱了模型的可靠性,凸显了在医疗AI中改进标注流程的必要性。
Acquiring high-quality annotations in medical imaging is usually a costly process. Automatic label extraction with natural language processing (NLP) has emerged as a promising workaround to bypass the need of expert annotation. Despite the convenience, the limitation of such an approximation has not been carefully examined and is not well understood. With a challenging set of 1,000 chest X-ray studies and their corresponding radiology reports, we show that there exists a surprisingly large discrepancy between what radiologists visually perceive and what they clinically report. Furthermore, with inherently flawed report as ground truth, the state-of-the-art medical NLP fails to produce high-fidelity labels.
研究动机与目标
- 调查放射科医生对胸部X光片的视觉解读与临床报告之间的差距。
- 评估NLP模型在报告本身存在误差时,从放射科报告中提取标签的可靠性。
- 识别医学影像标注差异的根本原因,特别是常被忽略的非行动性发现。
- 证明基于报告的标签本质上存在缺陷,导致以之为训练数据的下游AI模型性能低下。
- 倡导重新评估将放射科报告作为医疗AI开发中真实标签的使用方式。
提出的方法
- 整理了1,000份非筛查性胸部X光检查的影像与报告数据集。
- 安排两组专家放射科医生独立标注:一组仅基于影像阅片($y_{\text{img}}^{\text{rad}}$),另一组仅基于报告阅片($y_{\text{txt}}^{\text{rad}}$)。
- 使用最先进的医学NLP模型(Irvin et al., 2019)从报告中提取标签($y_{\text{txt}}^{\text{nlp}}$)。
- 通过精确率、召回率和F1分数量化基于影像的标签与基于报告的标签之间的一致性。
- 对不一致案例进行故障分析,将原因分类为非行动性发现、临界/细微发现、解剖变异、技术问题以及明显错误。
- 将NLP提取的标签与放射科医生报告的标签进行比较,评估在现实世界数据质量限制下的NLP性能。
实验结果
研究问题
- RQ1放射科医生对胸部X光片的视觉解读与临床报告之间存在多大程度的不一致?
- RQ2非行动性发现对放射科报告中标签差异的贡献程度如何?
- RQ3当NLP模型在包含临床无关或遗漏发现的放射科报告上进行训练时,其表现如何?
- RQ4报告标注中的主要错误来源是什么,它们如何影响下游AI模型的性能?
- RQ5当真实标签(即放射科报告)与视觉发现本身存在内在不一致时,NLP模型能否可靠地提取准确标签?
主要发现
- 在全局异常(Global Abnormal)类别中,基于影像的标签与基于报告的标签之间的一致性仅为69%,为所有发现中最高。
- 当使用报告标签作为真实标签时,NLP模型仅能识别出55.6%的图像验证发现,表明性能存在显著下降。
- 对于心脏扩大(Cardiomegaly),NLP与报告标签之间的F1分数仅为0.23,反映出因报告不一致导致的严重对齐偏差。
- 24%的报告将病例标记为正常,但影像阅片发现存在异常——表明存在严重的发现漏报。
- 20%的报告标记为异常的病例在影像上实际为正常——凸显了过度报告和假阳性问题。
- 不一致的主要原因是非行动性发现(如医疗设备、慢性改变和与年龄相关的发现)在放射科报告中被遗漏。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。