Skip to main content
QUICK REVIEW

[论文解读] Improving Factual Completeness and Consistency of Image-to-Text Radiology Report Generation

Yasuhide Miura, Yuhao Zhang|arXiv (Cornell University)|Oct 20, 2020
Topic Modeling参考文献 52被引用 15
一句话总结

本文提出两种新颖的奖励机制——精确实体匹配(Exact Entity Match)与蕴含实体匹配(Entailing Entity Match),并结合 BERTScore 以提升放射科报告生成中的事实完整性与一致性。通过在基于 Transformer 的模型上使用强化学习,该方法在临床信息抽取任务中实现了 22.1 的绝对 F1 分数提升(相对提升 63.9%),展现出相较于基线方法更优的事实准确性。

ABSTRACT

Neural image-to-text radiology report generation systems offer the potential to improve radiology reporting by reducing the repetitive process of report drafting and identifying possible medical errors. However, existing report generation systems, despite achieving high performances on natural language generation metrics such as CIDEr or BLEU, still suffer from incomplete and inconsistent generations. Here we introduce two new simple rewards to encourage the generation of factually complete and consistent radiology reports: one that encourages the system to generate radiology domain entities consistent with the reference, and one that uses natural language inference to encourage these entities to be described in inferentially consistent ways. We combine these with the novel use of an existing semantic equivalence metric (BERTScore). We further propose a report generation system that optimizes these rewards via reinforcement learning. On two open radiology report datasets, our system substantially improved the F1 score of a clinical information extraction performance by +22.1 (Delta +63.9%). We further show via a human evaluation and a qualitative analysis that our system leads to generations that are more factually complete and consistent compared to the baselines.

研究动机与目标

  • 为解决尽管 BLEU 和 CIDEr 分数较高,但神经网络图像到文本的放射科报告生成中仍存在的事实性不完整与不一致问题。
  • 通过提升生成报告与参考报告在疾病与解剖学实体覆盖范围以及推论一致性方面的对齐程度,增强报告的临床实用性。
  • 开发一种强化学习框架,利用领域特定且可解释的奖励优化事实正确性。
  • 在缺乏金标准临床信息抽取系统时,通过识别与事实准确性具有强相关性的指标,实现对报告质量的更好评估。

提出的方法

  • 提出精确实体匹配奖励(fact_ENT),用于衡量生成报告相对于参考报告中放射科特异性实体(如疾病、解剖结构)的覆盖程度。
  • 引入蕴含实体匹配奖励(fact_ENTNLI),结合 fact_ENT 与弱监督的自然语言蕴含(NLI)模型,以确保实体描述的推论一致性。
  • 整合 BERTScore 以捕捉语义等价性,包括同义词以及放射科报告中的复杂依赖关系(如否定)。
  • 使用弱监督方法训练放射科领域专用的 NLI 模型,以适应通用 NLI 模型在放射科术语与临床推理模式上的应用。
  • 采用基于 Transformer 的图像到文本生成器,通过自critical 强化学习优化复合奖励(NLL + BERTScore + fact_ENT + fact_ENTNLI)。
  • 在两个公开的放射科数据集上,利用临床信息抽取(如 CheXbert)与人工评估,衡量生成报告的事实完整性与一致性。

实验结果

研究问题

  • RQ1能否通过使用领域特定的事实性奖励替代标准 NLG 指标,来改善事实性不完整与不一致的报告?
  • RQ2在放射科报告生成中,基于 NLI 的奖励在多大程度上可提升实体层面的覆盖度与推论一致性?
  • RQ3当缺乏金标准信息抽取系统时,所提出的奖励能否作为临床准确性的可靠代理指标?
  • RQ4BERTScore 与事实性奖励的整合对生成报告的事实完整性与一致性产生何种影响?

主要发现

  • 与基线相比,该模型在 MIMIC-CXR 数据集上的临床信息抽取任务中实现了 22.1 的绝对 F1 分数提升(相对提升 63.9%)。
  • 由认证放射科医生进行的人工评估确认,使用所提奖励生成的报告在事实完整性与一致性方面优于基线模型。
  • fact_ENTNLI 奖励与临床准确性的斯皮尔曼等级相关系数最强(ρ = 0.255),显著优于 BLEU4(ρ = 0.092)与 CIDEr-D(ρ = 0.034)等标准指标。
  • 定性分析显示,该模型能正确生成关键发现(如肺不张),并抑制错误发现(如左侧胸腔积液),体现出更优的事实一致性。
  • 尽管有所改进,该模型在时间比较(如“相比上次研究更明显”)与不确定性表达(如“不能排除”)方面仍存在困难,表明其在建模纵向或概率性报告特征方面存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。