Skip to main content
QUICK REVIEW

[论文解读] Improving Factual Consistency of Abstractive Summarization via Question Answering

Nan Feng, Cícero Nogueira dos Santos|arXiv (Cornell University)|May 10, 2021
Topic Modeling参考文献 24被引用 5
一句话总结

本文提出了一种新颖的方法,通过引入一种高效的自动评估指标 Quals 和一种对比学习训练目标 ConSeq,以提升抽取式文本摘要中的事实一致性。该方法显著减少了幻觉现象,并在摘要基准测试中提升了自动评估与人工评估的得分。

ABSTRACT

A commonly observed problem with the state-of-the art abstractive summarization models is that the generated summaries can be factually inconsistent with the input documents. The fact that automatic summarization may produce plausible-sounding yet inaccurate summaries is a major concern that limits its wide application. In this paper we present an approach to address factual consistency in summarization. We first propose an efficient automatic evaluation metric to measure factual consistency; next, we propose a novel learning algorithm that maximizes the proposed metric during model training. Through extensive experiments, we confirm that our method is effective in improving factual consistency and even overall quality of the summaries, as judged by both automatic metrics and human evaluation.

研究动机与目标

  • 为解决抽取式摘要模型中事实不一致的严重问题,即生成的摘要常包含虚构或矛盾的事实。
  • 开发一种高效、可扩展的自动评估指标,用于衡量事实一致性,且可集成至训练过程中。
  • 设计一种对比学习算法 ConSeq,通过在训练过程中最大化事实一致性的可微代理指标,优化事实一致性。
  • 证明所提出的方法在不牺牲摘要质量的前提下提升了事实一致性,该结论通过自动指标与人工评估得到验证。

提出的方法

  • 提出 Quals,作为 QAGS 指标的简化版本,速度快 55 倍,利用单一的问题生成模型从摘要和输入文档中生成问题-答案对。
  • 基于输入文档与摘要中答案的负对数似然计算得分,得分越低表示事实一致性越好。
  • 设计 ConSeq,一种对比学习框架,通过最大化正样本(输入文档)与负样本(摘要)答案似然之间的差异,将事实一致性作为训练目标。
  • 将 Quals 得分作为可微的奖励信号,集成至 REINFORCE 风格的训练目标中,实现事实一致性的端到端优化。
  • 使用标准最大似然估计(MLE)损失与 ConSeq 对比损失相结合的方式训练摘要模型,平衡流畅性与事实准确性。
  • 使用单一的 QAGen 模型生成多样化的问题-答案对,实现对摘要中事实性陈述的高效且广泛覆盖。

实验结果

研究问题

  • RQ1能否设计一种计算高效的指标,用于衡量抽取式摘要中的事实一致性,且适用于模型训练过程?
  • RQ2与标准 MLE 训练相比,所提出的对比学习方法 ConSeq 在提升事实一致性方面的有效性如何?
  • RQ3通过 ConSeq 优化事实一致性是否能在自动指标与人工评估中带来可测量的提升?
  • RQ4与基线模型相比,该方法在多大程度上减少了生成摘要中的幻觉与事实性错误?
  • RQ5ConSeq 框架能否推广至摘要之外的其他序列到序列任务?

主要发现

  • 所提出的 Quals 指标在保持与人类评估及 QAGS 得分强相关性的同时,相比 QAGS 实现了 55 倍的速度提升。
  • ConSeq 训练显著提升了事实一致性,大幅减少了 BART-large 模型生成摘要中的幻觉现象。
  • 人工评估显示,使用 ConSeq 生成的摘要在事实一致性方面显著优于标准 MLE 微调生成的摘要。
  • 该方法在不降低流畅性或 ROUGE 得分的前提下提升了事实一致性,表明摘要质量得到了均衡提升。
  • 基于 Quals 的训练在 QAGS 和 FactCC 等事实一致性指标上均取得了更优表现,证实了该方法的有效性。
  • ConSeq 框架能有效减少常见事实错误,如错误的实体归属或虚假陈述,这一结论在定性分析示例中得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。