[论文解读] Optimizing the Factual Correctness of a Summary: A Study of Summarizing Radiology Reports
本文提出了一种强化学习框架,通过结合事实一致性奖励、ROUGE 和语言建模目标,优化神经抽象摘要模型的事实正确性。在放射科报告上的应用表明,该方法显著提升了事实准确性——相比基线模型减少30%的错误,同时生成的摘要在人类评估中几乎与人工撰写的一模一样。
Neural abstractive summarization models are able to generate summaries which have high overlap with human references. However, existing models are not optimized for factual correctness, a critical metric in real-world applications. In this work, we develop a general framework where we evaluate the factual correctness of a generated summary by fact-checking it automatically against its reference using an information extraction module. We further propose a training strategy which optimizes a neural summarization model with a factual correctness reward via reinforcement learning. We apply the proposed method to the summarization of radiology reports, where factual correctness is a key requirement. On two separate datasets collected from hospitals, we show via both automatic and human evaluation that the proposed approach substantially improves the factual correctness and overall quality of outputs over a competitive neural summarization system, producing radiology summaries that approach the quality of human-authored ones.
研究动机与目标
- 为解决神经抽象摘要中事实错误这一关键问题,特别是在放射科等高风险领域中,准确性至关重要。
- 开发一种可泛化的框架,通过信息抽取实现自动事实核查,提升事实正确性。
- 不仅优化文本重叠度(如ROUGE),还利用强化学习优化事实一致性,提升摘要模型性能。
- 在来自多家医院的真实放射科数据集上评估该方法的有效性。
- 证明提升事实正确性可生成临床上有效且接近人工撰写质量的摘要。
提出的方法
- 一个外部信息抽取(IE)模块从参考摘要和模型生成的摘要中提取事实,以计算事实准确性。
- 采用多目标强化学习(RL)训练策略,联合优化三个目标:事实正确性奖励、基于ROUGE的重叠度和语言建模损失。
- 事实正确性奖励通过比较生成摘要中提取的事实与黄金标准参考摘要中的事实,利用基于规则的IE系统计算得出。
- 通过策略梯度方法(如PPO)微调模型,以最大化组合目标,提升事实一致性。
- 该方法应用于在两个不同医院的放射科报告数据集上微调的先进序列到序列摘要模型。
- 训练一个独立的领域内语言模型以评估流畅性和风格,通过困惑度衡量生成摘要的人类相似度。
实验结果
研究问题
- RQ1是否能够通过将事实正确性作为奖励的强化学习框架,显著减少抽象摘要中的事实错误?
- RQ2优化事实正确性是否能提升放射科报告摘要的临床有效性和人类相似度?
- RQ3仅通过基于ROUGE的优化,能在多大程度上提升事实正确性,即使未显式引入事实奖励?
- RQ4与强基线模型相比,该方法在事实准确性、流畅性和风格一致性方面表现如何?
- RQ5在像放射科这样低歧义的领域中,能否有效利用信息抽取实现自动事实核查,以训练更可靠的摘要模型?
主要发现
- 所提出的基于强化学习并引入事实正确性奖励的方法(RL_R+C)相比强基线模型,将事实错误减少了约30%,显著提升了事实准确性。
- 人类评估显示,该方法生成的摘要在事实正确性和整体质量方面均优于基线输出,得分接近人工撰写摘要。
- 采用事实正确性奖励训练的模型在测试集上的困惑度得分(152.3)远优于基线模型(168.4),表明其流畅性和风格一致性更优。
- 即使未引入事实正确性奖励,仅通过强化学习优化ROUGE,也显著提升了事实正确性,表明ROUGE优化可间接支持事实一致性。
- 基线模型中出现频率最高的10个三元组被大量重复使用(例如,'no significant interval change'在34%的输出中出现),而所提方法生成的摘要更具多样性且更接近人类写作风格。
- 基于规则的IE系统成功识别出关键事实错误,如发现结果的错误存在/缺失(例如气胸),从而实现有效的事实核查与奖励设计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。