Skip to main content
QUICK REVIEW

[论文解读] Extractive Summarization as Text Matching

Ming Zhong, Pengfei Liu|arXiv (Cornell University)|Apr 19, 2020
Topic Modeling参考文献 47被引用 16
一句话总结

该论文提出 MatchSum,一种新颖的抽取式摘要框架,将任务表述为在共享嵌入空间中,将源文档与候选摘要进行语义文本匹配。通过使用孪生-BERT 架构计算语义相似度,模型选择与文档最相似的摘要作为最终结果,在仅使用 BERT-base 的情况下,于 CNN/DailyMail 数据集上实现了新的 SOTA ROUGE-1 得分 44.41,优于六个数据集上的强基线模型。

ABSTRACT

This paper creates a paradigm shift with regard to the way we build neural extractive summarization systems. Instead of following the commonly used framework of extracting sentences individually and modeling the relationship between sentences, we formulate the extractive summarization task as a semantic text matching problem, in which a source document and candidate summaries will be (extracted from the original text) matched in a semantic space. Notably, this paradigm shift to semantic matching framework is well-grounded in our comprehensive analysis of the inherent gap between sentence-level and summary-level extractors based on the property of the dataset. Besides, even instantiating the framework with a simple form of a matching model, we have driven the state-of-the-art extractive result on CNN/DailyMail to a new level (44.41 in ROUGE-1). Experiments on the other five datasets also show the effectiveness of the matching framework. We believe the power of this matching-based summarization framework has not been fully exploited. To encourage more instantiations in the future, we have released our codes, processed dataset, as well as generated summaries in https://github.com/maszhongming/MatchSum.

研究动机与目标

  • 解决传统句子级抽取器因独立决策而导致冗余摘要的问题。
  • 探究是否通过建模完整摘要的语义连贯性,摘要级方法能够超越句子级方法。
  • 基于摘要长度和是否存在“珍珠摘要”等数据集特性,量化句子级与摘要级抽取器之间的固有差距。
  • 提出一种新的抽取式摘要范式,通过对比学习绕过复杂的摘要级优化。
  • 证明语义匹配能够有效捕捉通过单个句子评分无法识别的协同句子组合。

提出的方法

  • 将抽取式摘要表述为语义文本匹配问题,目标是在语义空间中寻找与源文档最相似的候选摘要。
  • 使用孪生-BERT 架构将源文档和候选摘要编码为上下文嵌入表示。
  • 计算文档嵌入与每个候选摘要嵌入之间的余弦相似度,以对摘要进行排序。
  • 应用对比学习:优质摘要应比未达标摘要与文档具有更高的语义相似度。
  • 选择相似度得分最高的候选摘要作为最终的抽取式摘要。
  • 端到端训练模型,使用对比损失优化文档与其黄金摘要之间的语义对齐。

实验结果

研究问题

  • RQ1摘要级匹配框架是否在抽取式摘要任务中优于传统的句子级抽取器?
  • RQ2在不同基准数据集中,句子级与摘要级抽取器之间是否存在固有差距?
  • RQ3“珍珠摘要”(由多个评分中等但单独来看平庸的句子构成的摘要)的存在如何影响模型性能?
  • RQ4仅使用 BERT-base 的简单匹配模型在无需复杂解码或强化学习的情况下,能在多大程度上实现 SOTA 结果?
  • RQ5摘要长度及高分句子的分布如何影响基于匹配的框架的有效性?

主要发现

  • MatchSum 仅使用 BERT-base 即在 CNN/DailyMail 数据集上实现了新的 SOTA ROUGE-1 得分 44.41,优于之前的强基线模型。
  • MatchSum 的性能提升在包含“珍珠摘要”的样本中最为显著,这些样本由多个单独评分平庸但组合后高度连贯的句子构成。
  • 在 XSum 上,MatchSum 的学习比率 ψ(𝒟) 达到 0.64,表明具有显著的性能提升潜力;而在较长摘要数据集(如 PubMed 和 Multi-News)上,ψ(𝒟) 降至 0.2 以下,原因在于摘要级优化的上限更高。
  • 模型的改进与“珍珠摘要”的存在显著相关,而在黄金摘要由高分句子构成时效果较差。
  • 该框架的有效性与数据集特性存在定量关联:在“珍珠摘要”更多且摘要长度更短的数据集中,性能增益更明显。
  • 分析证实句子级与摘要级抽取器之间存在可测量的固有差距,验证了摘要级方法的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。