Skip to main content
QUICK REVIEW

[论文解读] Entity-level Factual Consistency of Abstractive Text Summarization

Nan Feng, Ramesh Nallapati|arXiv (Cornell University)|Feb 18, 2021
Topic Modeling参考文献 16被引用 5
一句话总结

本文提出基于实体的事实一致性度量——精确率-源(prec_s)、精确率-目标(prec_t)和召回率-目标(recall_t)——以量化生成式摘要中的幻觉现象。通过过滤训练数据以去除包含未登录词实体的摘要,并引入多任务实体分类头,作者显著减少了实体幻觉,在XSUM数据集上将prec_s从低于94%提升至98%以上,同时保持ROUGE分数基本不变。

ABSTRACT

A key challenge for abstractive summarization is ensuring factual consistency of the generated summary with respect to the original document. For example, state-of-the-art models trained on existing datasets exhibit entity hallucination, generating names of entities that are not present in the source document. We propose a set of new metrics to quantify the entity-level factual consistency of generated summaries and we show that the entity hallucination problem can be alleviated by simply filtering the training data. In addition, we propose a summary-worthy entity classification task to the training process as well as a joint entity and summary generation approach, which yield further improvements in entity level metrics.

研究动机与目标

  • 为解决生成式文本摘要中持续存在的实体幻觉问题,即模型生成源文档中不存在的实体。
  • 开发可靠、自动的事实一致性度量,用于量化实体级别的事实一致性,且独立于ROUGE。
  • 通过数据过滤、多任务学习和联合生成方法提升事实一致性,同时不牺牲ROUGE性能。
  • 在标准新闻摘要数据集(XSUM、CNN/DailyMail和Newsroom)上评估这些方法的有效性。

提出的方法

  • 提出精确率-源(prec_s)作为主要度量指标:prec_s = |摘要中的实体 ∩ 源文档中的实体| / |摘要中的实体|,用于衡量幻觉率。
  • 引入精确率-目标(prec_t)和召回率-目标(recall_t),以在实体层面评估生成摘要与标准摘要的一致性。
  • 应用现成的命名实体识别(SpaCy)与启发式规则进行实体匹配,支持n-gram、不区分大小写及停用词过滤的匹配方式。
  • 实施一种简单的数据过滤技术,即移除摘要中包含源文档中未出现的实体的训练样本。
  • 在训练过程中引入多任务学习设置,增加一个摘要关键实体分类头,以指导实体选择。
  • 提出一种联合序列生成模型,可同时生成摘要和关键实体列表。

实验结果

研究问题

  • RQ1SOTA生成式摘要模型(如BART)在多大程度上表现出实体级别的事实不一致?
  • RQ2自动度量如prec_s、prec_t和recall_t能否可靠地量化生成摘要中的实体级别事实一致性?
  • RQ3通过过滤训练数据以排除包含未登录词实体的摘要,是否能减少推理阶段的幻觉现象?
  • RQ4在实体分类任务上引入多任务学习,是否能在不降低ROUGE分数的前提下提升实体级别的事实一致性?
  • RQ5与标准自回归解码相比,联合生成实体和摘要的方法是否能进一步提升实体级别指标?

主要发现

  • XSUM数据集中真实摘要存在较高程度的实体幻觉,平均prec_s低于94%。
  • 仅通过数据过滤,XSUM测试集上的prec_s即从低于94%提升至98%以上,显著降低了幻觉现象。
  • 增加多任务实体分类头后,prec_s及其他实体级别指标进一步提升,且未降低ROUGE分数。
  • 联合生成实体与摘要的方法在实体级别指标上带来额外增益,尽管对ROUGE造成轻微损失。
  • 对10个XSUM验证样本的手动评估确认了NER与匹配流程的高准确性,验证了所提度量的可靠性。
  • 所提度量与方法在多个数据集(包括XSUM、CNN/DailyMail和Newsroom)上均有效,且在事实一致性方面保持一致的改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。