Skip to main content
QUICK REVIEW

[论文解读] Analyzing Sentence Fusion in Abstractive Summarization

Logan Lebanoff, John Muchovej|arXiv (Cornell University)|Oct 1, 2019
Topic Modeling参考文献 34被引用 4
一句话总结

本文通过使用人工标注评估五种最先进模型在 CNN/DailyMail 数据集上的表现,分析了生成式摘要中的句子融合问题。研究发现,38.3% 的融合摘要句子引入了错误事实,其中实体替换和复杂融合方法尤其容易出错,而简单拼接方法产生的输出在事实一致性和语法正确性方面表现更优。

ABSTRACT

While recent work in abstractive summarization has resulted in higher scores in automatic metrics, there is little understanding on how these systems combine information taken from multiple document sentences. In this paper, we analyze the outputs of five state-of-the-art abstractive summarizers, focusing on summary sentences that are formed by sentence fusion. We ask assessors to judge the grammaticality, faithfulness, and method of fusion for summary sentences. Our analysis reveals that system sentences are mostly grammatical, but often fail to remain faithful to the original article.

研究动机与目标

  • 探究最先进生成式摘要模型在句子融合这一内容整合核心挑战中的表现。
  • 评估通过组合多个源句生成的摘要句子在事实一致性、语法正确性及融合方法方面的表现。
  • 识别不同融合技术(如拼接、替换或复杂合并)在准确性和语法正确性方面的差异。
  • 比较多种模型(PG、Novel、Fast-Abs-RL、Bottom-Up、DCA)在生成事实一致且语法正确的融合句子方面的性能。
  • 为句子融合提供人工评估基准,弥补 ROUGE 等自动指标的局限性。

提出的方法

  • 通过 Amazon Mechanical Turk 进行人工评估,以判断摘要句子的事实一致性、语法正确性及融合方法。
  • 聚焦于通过句子融合生成的句子,将其与压缩、直接复制或匹配失败的句子区分开来。
  • 使用自动启发式方法识别源句对,覆盖率以正确识别的源句对占比衡量。
  • 将融合方法分类为:平衡/非平衡拼接、替换及其他复杂方法。
  • 分析五种最先进生成式摘要模型(包括 PG、Novel、Fast-Abs-RL、Bottom-Up 和 DCA)的输出。
  • 每例由四位标注员评估,以提升在事实一致性和语法正确性判断上的可靠性。

实验结果

研究问题

  • RQ1当摘要模型融合多个源句时,生成的句子在语法或事实方面出错的频率如何?
  • RQ2拼接、替换或复杂合并等句子融合技术中,哪种方法在事实一致性和语法正确性方面表现更优?
  • RQ3不同最先进模型在融合过程中的事实一致性与语法正确性表现有何差异?
  • RQ4用于识别源句对的自动启发式方法与人工判断的一致性如何?
  • RQ5为何复杂融合方法(如实体替换)相比简单方法(如拼接)错误率更高?

主要发现

  • 38.3% 的最先进模型生成的摘要句子包含错误事实,表明在句子融合过程中事实一致性仍面临重大挑战。
  • 21.6% 的摘要句子语法错误,其中‘其他’融合类别语法正确率最低(68.23%)。
  • 基于拼接的融合方法(平衡与非平衡)在事实一致性方面表现最佳(分别为 82.55% 和 69.40%),语法正确性也最高(分别为 86.91% 和 80.25%)。
  • 实体替换与复杂融合方法在 47%–75% 的情况下引入错误事实,表明高级融合技术错误率较高。
  • 自动启发式方法识别源句对的覆盖率为 77.3%(平均值),但在复杂情况下较低,影响了标注的可靠性。
  • 尽管 ROUGE 得分较高,PG 模型在事实一致性方面表现最佳(平衡拼接下为 82.55%),表明仅靠 ROUGE 无法充分评估事实一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。