Skip to main content
QUICK REVIEW

[论文解读] Effective extractive summarization using frequency-filtered entity relationship graphs

Archit Sakhadeo, Nisheeth Srivastava|arXiv (Cornell University)|Oct 24, 2018
Topic Modeling参考文献 12被引用 4
一句话总结

本文提出了一种混合抽取式摘要方法,结合基于词频的关键词识别与频率过滤的实体关系图,以提升摘要的信息量和连贯性。通过利用语言结构(主-谓-宾)构建实体图并基于关键词频率进行过滤,该方法在 DUC 2002 数据集上的 ROUGE-1 F 分数比 TextRank 高 7.93%,ROUGE-1 召回率高 17.12%,同时在人类感知的自然度方面也优于人工标注者。

ABSTRACT

Word frequency-based methods for extractive summarization are easy to implement and yield reasonable results across languages. However, they have significant limitations - they ignore the role of context, they offer uneven coverage of topics in a document, and sometimes are disjointed and hard to read. We use a simple premise from linguistic typology - that English sentences are complete descriptors of potential interactions between entities, usually in the order subject-verb-object - to address a subset of these difficulties. We have developed a hybrid model of extractive summarization that combines word-frequency based keyword identification with information from automatically generated entity relationship graphs to select sentences for summaries. Comparative evaluation with word-frequency and topic word-based methods shows that the proposed method is competitive by conventional ROUGE standards, and yields moderately more informative summaries on average, as assessed by a large panel (N=94) of human raters.

研究动机与目标

  • 解决纯频率基与图基抽取式摘要方法的局限性,例如上下文覆盖不足和摘要不连贯。
  • 通过将语言结构整合到实体关系图中,提升摘要的信息量与连贯性。
  • 通过从句子结构中自动提取实体关系,减少对预设本体的依赖。
  • 通过 ROUGE 指标与人工评分相结合的综合评估方法,全面衡量摘要质量。
  • 证明基于关键词频率过滤实体关系可提升摘要的相关性与覆盖范围。

提出的方法

  • 使用带共指消解的开放信息抽取(OpenIE)从句子中提取候选主-动-宾三元组。
  • 构建实体关系图,其中节点为实体,边为实体之间的关系。
  • 通过频率过滤,仅保留包含文档中高频关键词的实体关系。
  • 根据句子所包含的过滤后高频实体关系数量对句子进行排序。
  • 选取排名靠前的句子组成最终的抽取式摘要,可选地通过句子长度归一化以减少对长句的偏倚。
  • 采用混合评分机制,结合关键词频率与图中心性,优先选择语义相关且连接度高的句子。

实验结果

研究问题

  • RQ1将关键词频率与实体关系图结合,能否在抽取式摘要中超越纯频率基或图基基线方法?
  • RQ2使用关键词频率过滤实体关系,是否能提升摘要的覆盖范围与连贯性?
  • RQ3所提出方法在标准 ROUGE 指标与人工评估中,与最先进抽取式摘要器相比表现如何?
  • RQ4该方法生成的摘要在多大程度上与人工生成摘要难以区分?
  • RQ5该方法能否在保持或提升 ROUGE 分数的同时,减少对长句的偏倚?

主要发现

  • 在 DUC 2002 数据集上经归一化后,该方法的 ROUGE-1 F 分数比 TextRank 高 7.93%,ROUGE-1 召回率高 17.12%。
  • 该方法不仅优于 TextRank 和 LexRank 等经典方法,也优于 McDonald(2007)和 Gillick 与 Favre(2009)等较新方法的 ROUGE 指标。
  • 人工评分显示,该方法生成的摘要比基线方法更具信息量与连贯性,且更可能被误判为人工生成。
  • 由于过滤机制保留了语境中重要的关系,该方法在短摘要中表现出更优的内容覆盖能力。
  • 无论是 ROUGE 分数还是人工评估均表明,该方法在提升主题相关性内容捕捉能力的同时,有效减少了冗余。
  • 作者发现,句子长度归一化可进一步提升精确率,提示未来优化具有显著潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。