Skip to main content
QUICK REVIEW

[论文解读] Improving Radiology Report Generation Systems by Removing Hallucinated References to Non-existent Priors

Vignav Ramesh, Nathan Andrew Chi|arXiv (Cornell University)|Sep 27, 2022
Topic Modeling被引用 12
一句话总结

本文提出 CXR-ReDonE,一种通过消除对不存在的先前报告的幻觉性引用以提升临床准确性的放射科报告生成模型。通过使用基于 BioBERT 的标记分类器(GILBERT)预处理 MIMIC-CXR 数据集以去除先前引用,作者在清理后的数据上微调 CXR-RePaiR,使 BERTScore 提升 2.57%(达到 0.2351),并显著减少生成报告中的幻觉。

ABSTRACT

Current deep learning models trained to generate radiology reports from chest radiographs are capable of producing clinically accurate, clear, and actionable text that can advance patient care. However, such systems all succumb to the same problem: making hallucinated references to non-existent prior reports. Such hallucinations occur because these models are trained on datasets of real-world patient reports that inherently refer to priors. To this end, we propose two methods to remove references to priors in radiology reports: (1) a GPT-3-based few-shot approach to rewrite medical reports without references to priors; and (2) a BioBERT-based token classification approach to directly remove words referring to priors. We use the aforementioned approaches to modify MIMIC-CXR, a publicly available dataset of chest X-rays and their associated free-text radiology reports; we then retrain CXR-RePaiR, a radiology report generation system, on the adapted MIMIC-CXR dataset. We find that our re-trained model--which we call CXR-ReDonE--outperforms previous report generation methods on clinical metrics, achieving an average BERTScore of 0.2351 (2.57% absolute improvement). We expect our approach to be broadly valuable in enabling current radiology report generation systems to be more directly integrated into clinical pipelines.

研究动机与目标

  • 为解决放射科报告生成模型中普遍存在对不存在的先前报告的幻觉性引用问题。
  • 通过从训练数据中移除先前引用,提升生成报告的事实一致性和临床可靠性。
  • 开发一种可扩展、高效的先前引用移除方法,同时保持语义和临床保真度。
  • 实现自动化报告生成系统在真实临床工作流中的更好集成。
  • 证明数据预处理——特别是先前引用的移除——可显著提升下游模型性能。

提出的方法

  • 作者提出 MIMIC-PRO,即经过清理的 MIMIC-CXR 数据集版本,通过两阶段流程(FilBERT+GPT-3 和 GILBERT)去除先前引用。
  • GILBERT 是一个微调后的 BioBERT 模型,执行标记级分类以识别并移除指代先前报告的词语。
  • 该模型在 MIMIC-PRO 上进行训练,该数据集中 68.3% 的先前引用被消除,实例数从 259,376 降至 82,074。
  • CXR-ReDonE 在 MIMIC-PRO 上使用对比学习框架进行微调,结合图像和文本编码器以对齐报告与放射图像的嵌入。
  • 报告生成通过选择图像嵌入与文本嵌入之间点积相似度最高的输出完成。
  • 评估使用语义指标:BERTScore、$s_{emb}$(通过 CheXbert 计算的余弦相似度)和 RadGraph $F_1$,以评估事实一致性和临床实体重叠。

实验结果

研究问题

  • RQ1在训练数据中移除对不存在的先前报告的幻觉性引用,能否提升放射科报告生成模型的事实一致性?
  • RQ2基于 BioBERT 的标记分类模型(GILBERT)在识别和移除先前引用方面,与基于 GPT-3 的重写方法相比效果如何?
  • RQ3在去除先前引用的数据集上微调报告生成模型,能在临床指标上带来多大程度的性能提升?
  • RQ4生成报告中缺少先前引用是否能提升与放射科医生撰写报告的一致性,并改善在临床流程中的集成?
  • RQ5数据预处理策略是否能在提升报告生成质量方面超越架构创新?

主要发现

  • CXR-ReDonE 在专家编辑的测试集上达到 BERTScore 0.2351,相比最佳基线模型绝对提升 2.57%。
  • 对于 $k=1$,模型在 $s_{emb}$ 上达到 0.3967,相比最佳基线提升 2.24%。
  • 对于 $k=3$,CXR-ReDonE 在 RadGraph $F_1$ 上达到 0.1112,相比最强基线提升 2.68%。
  • 数据集中先前引用的数量从 MIMIC-CXR 的 259,376 项减少至 MIMIC-PRO 的 82,074 项,减少超过 68.3%。
  • GILBERT 在先前引用检测上的 $F_1$ 得分为 0.84,优于 FilBERT+GPT-3 流程的 $F_1 = 0.56$,在准确性和成本效率方面均更优。
  • 定性分析表明,CXR-ReDonE 生成的报告在诊断准确性方面表现优异,且远少于基线模型的幻觉性先前研究引用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。