Skip to main content
QUICK REVIEW

[论文解读] Combining Word Embeddings and N-grams for Unsupervised Document Summarization

Zhuolin Jiang, Manaj Srivastava|arXiv (Cornell University)|Apr 25, 2020
Topic Modeling参考文献 28被引用 4
一句话总结

该论文提出了一种无监督、抽取式文档摘要方法,通过融合预训练词嵌入(word2vec、BERT)与n-gram特征,提升句子相似度计算,从而改进基于图的子模摘要方法。此外,该方法引入了一种基于Transformer的句子压缩模型,在DUC04数据集上实现了最先进性能,且无需监督训练,其在CNN/DM和NYT数据集上的表现与监督模型相当。

ABSTRACT

Graph-based extractive document summarization relies on the quality of the sentence similarity graph. Bag-of-words or tf-idf based sentence similarity uses exact word matching, but fails to measure the semantic similarity between individual words or to consider the semantic structure of sentences. In order to improve the similarity measure between sentences, we employ off-the-shelf deep embedding features and tf-idf features, and introduce a new text similarity metric. An improved sentence similarity graph is built and used in a submodular objective function for extractive summarization, which consists of a weighted coverage term and a diversity term. A Transformer based compression model is developed for sentence compression to aid in document summarization. Our summarization approach is extractive and unsupervised. Experiments demonstrate that our approach can outperform the tf-idf based approach and achieve state-of-the-art performance on the DUC04 dataset, and comparable performance to the fully supervised learning methods on the CNN/DM and NYT datasets.

研究动机与目标

  • 通过用深度语义特征替代传统的tf-idf,改进基于图的抽取式摘要中的句子相似度度量。
  • 探究将预训练词嵌入(word2vec、BERT)与n-gram特征结合,以提升无监督摘要中语义表示的有效性。
  • 评估使用基于Transformer的句子压缩模型对抽取式摘要性能的影响。
  • 在基准数据集上实现最先进或具有竞争力的性能,且无需使用标注的摘要对。

提出的方法

  • 构建一种新颖的句子相似度图,采用融合tf-idf与预训练词嵌入(word2vec、BERT)的度量方法,以提升语义相似度估计。
  • 应用结合加权覆盖度与多样性项的子模目标函数,在预算约束下选择具有代表性和多样性的句子。
  • 使用贪心算法最大化子模目标函数,并通过局部邻域统计信息对句子成本进行归一化。
  • 在Gigaword和Google句子压缩数据集上训练基于Transformer的模型,以在摘要前对输入句子进行压缩。
  • 在句子相似度计算中采用晚期融合策略,结合词嵌入与n-gram特征。
  • 在DUC04、CNN/DM和NYT50数据集上,使用三句摘要预算,采用ROUGE分数(R-1、R-2、R-L)进行评估。

实验结果

研究问题

  • RQ1将现成的词嵌入与n-gram特征结合,是否能提升无监督摘要中句子相似度估计的性能?
  • RQ2将深度语义特征(word2vec、BERT)与稀疏的tf-idf特征融合,是否能带来优于单独使用任一特征的摘要性能?
  • RQ3应用基于Transformer的句子压缩模型在多大程度上能提升抽取式摘要性能?
  • RQ4无监督摘要系统是否能在CNN/DM和NYT数据集上实现与监督最先进方法相当的性能?

主要发现

  • 所提出的GraphFusion方法结合word2vec与tf-idf特征,在CNN/DM数据集上达到39.0 R-1、16.8 R-2与32.0 R-L F-score,优于tf-idf和仅使用嵌入的基线模型。
  • 在DUC04数据集上,通过额外使用Google句子压缩数据集(除Gigaword外),该方法在所有三项ROUGE指标(R-1、R-2、R-L)上均实现1个百分点的绝对提升,优于当前基线。
  • LateFusion方法结合word2vec与n-gram特征,在CNN/DM数据集上表现最佳,达到39.2 R-1、17.1 R-2与32.2 R-L F-score。
  • 基于Transformer的句子压缩模型显著提升了DUC04上的摘要性能,相比基线压缩模型,ROUGE-1、ROUGE-2与ROUGE-L的绝对提升接近2个百分点。
  • 尽管该方法为无监督且未使用训练数据,其性能仍可与Pointer和Refresh等监督模型在CNN/DM和NYT数据集上的表现相媲美。
  • 在CNN/DM上,句子压缩未带来性能提升,可能由于在固定三句摘要预算下导致信息损失;但在DUC04上,性能显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。