Skip to main content
QUICK REVIEW

[论文解读] DivGraphPointer: A Graph Pointer Network for Extracting Diverse Keyphrases

Zhiqing Sun, Jian Tang|arXiv (Cornell University)|May 19, 2019
Advanced Text Analysis Techniques参考文献 48被引用 6
一句话总结

本文提出 DivGraphPointer,一种端到端的图指针网络,结合图卷积网络(GCNs)进行文档级词语显著性建模,并采用多样化指针网络生成多样化的关键词。通过构建捕捉长距离依赖关系并聚合重复词语的词语图,利用覆盖注意力机制和多样性损失以减少冗余,DivGraphPointer 在五个基准数据集上达到最先进性能,显著优于先前的监督与无监督方法。

ABSTRACT

Keyphrase extraction from documents is useful to a variety of applications such as information retrieval and document summarization. This paper presents an end-to-end method called DivGraphPointer for extracting a set of diversified keyphrases from a document. DivGraphPointer combines the advantages of traditional graph-based ranking methods and recent neural network-based approaches. Specifically, given a document, a word graph is constructed from the document based on word proximity and is encoded with graph convolutional networks, which effectively capture document-level word salience by modeling long-range dependency between words in the document and aggregating multiple appearances of identical words into one node. Furthermore, we propose a diversified point network to generate a set of diverse keyphrases out of the word graph in the decoding process. Experimental results on five benchmark data sets show that our proposed method significantly outperforms the existing state-of-the-art approaches.

研究动机与目标

  • 解决现有关键词抽取方法的局限性,这些方法要么依赖启发式规则,要么无法有效建模文档级词语显著性与多样性。
  • 开发一种端到端可训练的模型,以捕捉长距离词语依赖关系,并将多个词语出现聚合为单一节点。
  • 通过防止模型重复选择语义相似或冗余的短语,实现关键词的多样化生成。
  • 通过结合图模型排序与神经序列生成的优势,提升关键词抽取性能。

提出的方法

  • 利用词语邻近度定义边,从输入文档构建词语图,将相同词语聚合为单一节点。
  • 应用图卷积网络(GCNs)对词语图进行编码,捕捉短距离与长距离依赖关系,并将多个词语出现聚合为显著的节点表示。
  • 使用多样化指针网络解码器,以自回归方式从词语图中动态选择节点,形成关键词。
  • 引入覆盖注意力机制,追踪已关注的词语,减少生成关键词中的冗余。
  • 基于关键词之间余弦相似度的倒数设计多样性损失,明确鼓励语义多样性。
  • 在解码过程中引入长度惩罚因子,以控制生成关键词的粒度,平衡短语与长语之间的关系。

实验结果

研究问题

  • RQ1基于图的编码方法是否能通过捕捉长距离依赖关系并聚合重复词语,有效建模文档级词语显著性?
  • RQ2在词语图上使用指针网络是否能生成多样化的关键词,同时保持与文档的高度相关性?
  • RQ3覆盖注意力机制与多样性损失的结合在减少关键词生成冗余方面有多有效?
  • RQ4所提出的端到端框架是否优于监督与无监督的最先进关键词抽取方法?

主要发现

  • DivGraphPointer 在五个基准数据集(包括 Krapivin、Inspec 等)上显著优于现有最先进监督与无监督方法。
  • 多样性机制将平均相同关键词共现率(AIC)相比 GraphPointer 最多降低 50%,尤其在前 5 个关键词中改善最为显著。
  • 长度惩罚因子对性能有显著影响,Inspec 数据集的最优值在 0–1 之间,Krapivin 数据集在 1–5 之间,表明极端的归一化值会降低结果质量。
  • 案例研究显示,与 CopyRNN 和 GraphPointer 相比,DivGraphPointer 生成的关键词语义更丰富,冗余更少,且更贴合关键概念。
  • 基于图的编码器能有效捕捉词语相关性(如 'traffic' 与 'noise' 强关联),从而实现比序列模型更准确的关键词选择。
  • 采用多样性机制的模型(DivGraphPointer-100)仅生成两个高度相似的关键词,而 CopyRNN 与 GraphPointer-100 分别生成五个与四个,充分证明了其在减少冗余方面的强大能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。