[论文解读] VisualCheXbert: Addressing the Discrepancy Between Radiology Report Labels and Image Labels
本文提出 VisualCheXbert,一种利用生物医学微调的 BERT 模型将放射科报告直接映射到基于图像的标签的方法,提升了与放射科医生对胸部 X 光片解读的一致性。其 F1 分数比放射科医生标注报告高出 0.12–0.21,比 CheXpert 报告标注器高出 0.14,减少了基于报告与基于图像的标签之间的差异。
Automatic extraction of medical conditions from free-text radiology reports is critical for supervising computer vision models to interpret medical images. In this work, we show that radiologists labeling reports significantly disagree with radiologists labeling corresponding chest X-ray images, which reduces the quality of report labels as proxies for image labels. We develop and evaluate methods to produce labels from radiology reports that have better agreement with radiologists labeling images. Our best performing method, called VisualCheXbert, uses a biomedically-pretrained BERT model to directly map from a radiology report to the image labels, with a supervisory signal determined by a computer vision model trained to detect medical conditions from chest X-ray images. We find that VisualCheXbert outperforms an approach using an existing radiology report labeler by an average F1 score of 0.14 (95% CI 0.12, 0.17). We also find that VisualCheXbert better agrees with radiologists labeling chest X-ray images than do radiologists labeling the corresponding radiology reports by an average F1 score across several medical conditions of between 0.12 (95% CI 0.09, 0.15) and 0.21 (95% CI 0.18, 0.24).
研究动机与目标
- 调查放射科医生标注放射科报告与标注相应胸部 X 光片之间差异的程度。
- 识别报告标签与图像标签之间不一致的主要原因,包括标签层级、临床病史访问情况以及报告各部分的使用情况。
- 开发一种方法,学习将放射科报告直接映射到图像标签,且与放射科医生标注的图像标签具有更高的一致性。
- 通过减少基于报告标签的噪声,提升用于训练医学视觉模型的弱监督质量。
提出的方法
- VisualCheXbert 使用经过生物医学预训练的 BERT 模型,将放射科报告文本直接映射到基于图像的标签。
- 该模型通过一个预先训练以从胸部 X 光片中检测 14 种医学状况的计算机视觉模型提供的监督信号进行训练。
- 训练目标是最小化模型预测标签与 CV 模型预测之间的差异,从而将报告解读与基于图像的诊断对齐。
- 该方法利用放射科报告的“结论”部分作为输入,聚焦于临床相关的摘要信息。
- 通过在 CheXpert 测试集上与放射科医生标注的图像标签对比,使用 F1 分数评估模型性能。
- 该方法优于放射科医生标注报告以及现有的 CheXpert 规则基标签器。

实验结果
研究问题
- RQ1当放射科医生分别标注放射科报告和相应胸部 X 光片时,其一致性程度如何?
- RQ2放射科医生在基于报告与基于图像的标注之间不一致的主要原因是什么?
- RQ3从报告中标注的病症与图像中实际存在的病症之间是否存在统计学上显著的相关性?
- RQ4是否可以训练一个深度学习模型,使其将放射科报告直接映射到图像标签,且与人类标注报告的一致性更高?
主要发现
- 标注报告的放射科医生与标注图像的放射科医生之间一致性较低,各类病症的平均 Kappa 分数在 0.312 到 0.430 之间。
- VisualCheXbert 的平均 F1 分数比放射科医生标注报告高出 0.12–0.21,95% 置信区间分别为 (0.09, 0.15) 和 (0.18, 0.24)。
- 与同一评估集上的 CheXpert 规则基报告标签器相比,VisualCheXbert 的 F1 分数提高了 0.14(95% 置信区间:0.12, 0.17)。
- 报告中对子病症的标签显著提高了图像中其父病症的出现几率,表明标签层级关系在临床上具有意义。
- 某些不确定的报告标签也增加了图像中对应病症的出现几率,表明模糊报告语言中存在细微的诊断信号。
- 阳性“肺不张”报告标签使图像中“支持装置”出现的几率降低 0.28 倍,表明可能存在代偿性或混杂关系。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。