Skip to main content
QUICK REVIEW

[论文解读] Keyphrase Generation with Cross-Document Attention

Shizhe Diao, Yan Song|arXiv (Cornell University)|Apr 21, 2020
Advanced Text Analysis Techniques参考文献 45被引用 7
一句话总结

本文提出 CDKGen,一种基于 Transformer 的关键词生成模型,通过整合跨文档注意力机制,捕捉语料库中潜在的主题和全局文档依赖关系,从而提升关键词抽取效果。通过利用多个参考文档和针对 OOV 词汇的复制机制,CDKGen 在五个基准数据集上实现了最先进性能,显著提升了关键词的相关性和多样性。

ABSTRACT

Keyphrase generation aims to produce a set of phrases summarizing the essentials of a given document. Conventional methods normally apply an encoder-decoder architecture to generate the output keyphrases for an input document, where they are designed to focus on each current document so they inevitably omit crucial corpus-level information carried by other similar documents, i.e., the cross-document dependency and latent topics. In this paper, we propose CDKGen, a Transformer-based keyphrase generator, which expands the Transformer to global attention with cross-document attention networks to incorporate available documents as references so as to generate better keyphrases with the guidance of topic information. On top of the proposed Transformer + cross-document attention architecture, we also adopt a copy mechanism to enhance our model via selecting appropriate words from documents to deal with out-of-vocabulary words in keyphrases. Experiment results on five benchmark datasets illustrate the validity and effectiveness of our model, which achieves the state-of-the-art performance on all datasets. Further analyses confirm that the proposed model is able to generate keyphrases consistent with references while keeping sufficient diversity. The code of CDKGen is available at https://github.com/SVAIGBA/CDKGen.

研究动机与目标

  • 解决传统关键词生成模型仅关注单个文档、忽略语料级主题信息的局限性。
  • 通过整合来自多个相关文档的潜在主题,提升关键词的相关性和多样性。
  • 通过复制机制处理关键词中的未登录词(OOV),直接从源文档中选取术语。
  • 开发一种全局注意力机制,使模型在生成关键词时能够关注多个文档中的相关内容。
  • 在保持与参考文档一致性和输出多样性的前提下,实现在关键词生成基准上的最先进性能。

提出的方法

  • CDKGen 在标准 Transformer 编码器-解码器架构基础上,引入跨文档注意力机制,使解码器能够关注多个相关文档的表示。
  • 跨文档注意力模块计算解码器隐藏状态与一组参考文档编码表示之间的注意力分数,使模型能够访问语料库中共享的主题模式。
  • 在解码器中集成复制机制,允许直接从输入文档中复制词汇,尤其有利于罕见或未登录词的关键词生成。
  • 采用交叉熵损失与复制门控机制相结合的方式,端到端训练模型,以平衡生成与复制词汇的决策。
  • 编码器独立处理每篇文档,而解码器则同时关注参考文档集合中的所有文档,以在解码过程中丰富上下文信息。
  • 该架构支持动态参考文档集,使模型能够根据输入自适应地关注最相关的文档。

实验结果

研究问题

  • RQ1通过捕捉多篇文档之间的潜在主题结构,引入跨文档注意力是否能提升关键词生成效果?
  • RQ2引入多篇参考文档在多大程度上影响了生成关键词的相关性和多样性?
  • RQ3复制机制在未登录词关键词生成任务中,能多大程度上提升性能?
  • RQ4所提出的模型是否在标准基准数据集上优于现有的最先进方法?
  • RQ5生成的关键词在与参考关键词保持一致的同时,是否仍具备足够的多样性?

主要发现

  • CDKGen 在全部五个基准数据集上均达到最先进性能,在精确率和召回率指标上均优于先前方法。
  • 通过跨文档注意力机制利用多篇文档的主题信息,模型显著提升了与参考关键词的一致性。
  • 复制机制显著提升了对罕见词和未登录词的生成性能,有效减少了这些词汇的生成错误。
  • 消融实验表明,跨文档注意力机制和复制机制均对模型性能有独立且显著的贡献。
  • 生成的关键词在与输入文档的相关性与不同输出之间的多样性之间表现出良好的平衡。
  • 定性分析表明,CDKGen 生成的关键词在语义上连贯,并与输入文档和参考文档的主要主题保持一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。