Skip to main content
QUICK REVIEW

[论文解读] Improving Faithfulness in Abstractive Summarization with Contrast Candidate Generation and Selection

Sihao Chen, Fan Zhang|arXiv (Cornell University)|Apr 19, 2021
Topic Modeling参考文献 23被引用 7
一句话总结

本文提出一种模型无关的后处理方法,通过生成对比候选摘要来提升抽取式摘要的忠实度。该方法利用源文中语义兼容的替代项对摘要中的实体和数量进行替换,生成对比候选摘要,再使用判别模型选择最忠实的候选摘要。该方法在多个神经网络模型上有效减少了摘要中的外在幻觉,尤其在 XSum 数据集上表现显著,尽管由于错误替换导致引入少量内在幻觉。

ABSTRACT

Despite significant progress in neural abstractive summarization, recent studies have shown that the current models are prone to generating summaries that are unfaithful to the original context. To address the issue, we study contrast candidate generation and selection as a model-agnostic post-processing technique to correct the extrinsic hallucinations (i.e. information not present in the source text) in unfaithful summaries. We learn a discriminative correction model by generating alternative candidate summaries where named entities and quantities in the generated summary are replaced with ones with compatible semantic types from the source document. This model is then used to select the best candidate as the final output summary. Our experiments and analysis across a number of neural summarization systems show that our proposed method is effective in identifying and correcting extrinsic hallucinations. We analyze the typical hallucination phenomenon by different types of neural summarization systems, in hope to provide insights for future work on the direction.

研究动机与目标

  • 为解决神经网络抽取式摘要中持续存在的外在幻觉问题,即模型生成源文本中不存在的事实。
  • 开发一种无需微调原始模型的后处理技术,仅利用源文档和生成的摘要来纠正幻觉摘要。
  • 研究在训练数据本身包含高比例幻觉样本(如 XSum 数据集)的场景下,对比候选生成与选择的有效性。
  • 分析不同神经摘要模型中幻觉的类型与来源,尤其关注命名实体和数值。
  • 为实体层面忠实度的局限性及其与整体摘要忠实度的关系提供洞见。

提出的方法

  • 通过将给定摘要中的幻觉命名实体和数量,替换为从源文档中提取的语义兼容替代项,生成对比候选摘要。
  • 使用一个判别模型对忠实摘要与合成负样本(即实体/数量被替换的摘要)进行区分,以对候选摘要进行排序并选择最佳结果。
  • 利用从源文档及其潜在幻觉摘要中自动构建的训练数据来训练选择模型,重点关注实体和数量类型。
  • 将该方法作为后处理步骤,应用于任何预训练的抽取式摘要模型之后,使其具备模型无关性,可广泛部署于各类系统。
  • 基于实体类型(如日期、人物、组织)和数值一致性(如数量级、语境上合理取值)定义语义兼容性。
  • 使用 ROUGE 和 BertScore 等自动指标评估性能,同时辅以人工评估以衡量忠实度及内在/外在幻觉率。

实验结果

研究问题

  • RQ1对比候选生成与选择是否能在不微调原始模型的前提下,有效减少抽取式摘要中的外在幻觉?
  • RQ2该方法在不同神经摘要架构(包括 RNN 和 Transformer 模型)上的表现如何?
  • RQ3在纠正外在幻觉与因错误替换引入内在幻觉之间存在何种权衡?
  • RQ4实体层面忠实度与摘要层面忠实度的相关性如何?仅修复实体幻觉是否足以保证整体摘要的忠实度?
  • RQ5预训练效果和模型先验如何影响该纠正方法的成功与失败案例?

主要发现

  • 该方法在 XSum 数据集上显著减少了最先进模型生成摘要中的外在幻觉,尤其在命名实体和数量方面。
  • 该方法在忠实度方面实现了可测量的提升,显著减少了幻觉实体与数值,同时保持了高流畅度与关键信息保留度。
  • 尽管效果显著,该方法在源文档中无有效替换项时,仍会引入少量内在幻觉(约 1.9% 的情况)。
  • 具有预训练的模型(如 BART、RoBERTa)由于预训练数据中的模式或偏差,更容易产生错误替换。
  • 实体层面的忠实度不能保证摘要层面的忠实度,因为即使实体替换正确,模型仍可能生成事实性错误的语句。
  • 人工评估确认,该方法在 73.1% 的外在幻觉发生案例中有效纠正了幻觉,但无法完全解决需要常识推理或知识检索的复杂事实不一致问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。