Skip to main content
QUICK REVIEW

[论文解读] Multi-Fact Correction in Abstractive Text Summarization

Yue Dong, Shuohang Wang|arXiv (Cornell University)|Oct 6, 2020
Topic Modeling参考文献 36被引用 5
一句话总结

本文提出 SpanFact,一种双模型框架,通过利用问答模型识别并替换错误实体(基于跨度选择)来纠正生成式文本摘要中的事实性不一致。该方法在不降低 ROUGE 分数的前提下提升了事实一致性,在多个数据集上的自动评估与人工评估中均取得显著提升。

ABSTRACT

Pre-trained neural abstractive summarization systems have dominated extractive strategies on news summarization performance, at least in terms of ROUGE. However, system-generated abstractive summaries often face the pitfall of factual inconsistency: generating incorrect facts with respect to the source text. To address this challenge, we propose Span-Fact, a suite of two factual correction models that leverages knowledge learned from question answering models to make corrections in system-generated summaries via span selection. Our models employ single or multi-masking strategies to either iteratively or auto-regressively replace entities in order to ensure semantic consistency w.r.t. the source text, while retaining the syntactic structure of summaries generated by abstractive summarization models. Experiments show that our models significantly boost the factual consistency of system-generated summaries without sacrificing summary quality in terms of both automatic metrics and human evaluation.

研究动机与目标

  • 解决生成式文本摘要中的事实不一致问题,即模型在 ROUGE 分数较高的情况下仍会产生幻觉性事实。
  • 开发一种后处理校正框架,在不改变生成摘要句法结构的前提下提升事实正确性。
  • 利用预训练问答模型的知识,识别并替换摘要中的错误实体。
  • 确保校正过程保留信息量与流畅性,同时增强与源文档的一致性。
  • 在多个基准数据集上,结合自动指标与人工标注对方法进行评估。

提出的方法

  • 该方法采用两种校正模型:基于 QA 的跨度模型通过单重掩码与问答机制,迭代替换实体;自回归模型则通过多重掩码实现序列化实体校正。
  • 每种模型均使用预训练的 QA 模型,基于被掩码的实体生成查询,然后从源文本中选择最符合上下文的替代项。
  • 校正过程保留了生成式摘要的原始句法结构,仅替换错误的跨度(主要为实体)。
  • 该方法作为后处理步骤,应用于 SOTA 生成模型(如 BertAbs、Pointer-Generator 和 TransformerAbs)生成的摘要。
  • QA-跨度模型一次仅对一个被掩码的实体进行条件建模,而自回归模型则在一次前向传播中同时掩码并校正多个实体。
  • SpanFact 通过端到端的跨度选择目标进行训练,以最大化基于源文本上下文的正确实体替换概率。

实验结果

研究问题

  • RQ1后处理校正方法是否能在不降低 ROUGE 分数的前提下提升生成式摘要的事实一致性?
  • RQ2基于问答的跨度选择在识别并替换摘要中幻觉性实体方面有多有效?
  • RQ3在自回归设置中使用多重掩码是否优于单重掩码结合迭代 QA 的方法?
  • RQ4该方法在具有不同幻觉程度的多样化摘要数据集上表现如何?
  • RQ5在事实准确性方面,人工评估者在多大程度上更偏好经校正的摘要而非原始摘要?

主要发现

  • 在 FactCC 基准上,QA-跨度模型将 FactCC 分数从 84.89 提升至 86.08,人工评估分数从 87.79 提升至 90.74。
  • 自回归模型将 FactCC 分数从 84.89 提升至 85.96,人工评估分数从 87.79 提升至 90.35。
  • 在 CNN/DailyMail 数据集上,QA-跨度模型在人工评估中纠正了 62 个错误实体中的 18 个,自回归模型纠正了其中的 16 个。
  • 人工评估显示,在 31.3% 的成对比较中,评估者更偏好自回归模型校正后的摘要;在与 BertAbs 生成的摘要对比中,38% 的比较更偏好自回归模型结果。
  • 在 XSum 数据集上,自回归模型优于 QA-跨度模型,因源摘要中幻觉率较高,单重掩码的可靠性下降。
  • 在 FactCC 数据集中,446 个标注正确的句子中,模型仅错误地更改了 3–4 个实体,表明校正具有高精确度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。