Skip to main content
QUICK REVIEW

[论文解读] Title-Guided Encoding for Keyphrase Generation

Wang Chen, Yifan Gao|arXiv (Cornell University)|Aug 26, 2018
Advanced Text Analysis Techniques参考文献 55被引用 3
一句话总结

本文提出标题引导网络(TG-Net),一种新颖的编码器-解码器模型,用于关键词生成。该模型将文档标题视为类似查询的输入,并利用注意力机制,通过标题信息引导上下文编码。TG-Net 显著优于当前最先进模型,在缺失关键词预测任务中,F1@10 最高提升 9.4%,Recall@50 最高提升 19.1%,尤其在标题极短或极长的文档中表现更优。

ABSTRACT

Keyphrase generation (KG) aims to generate a set of keyphrases given a document, which is a fundamental task in natural language processing (NLP). Most previous methods solve this problem in an extractive manner, while recently, several attempts are made under the generative setting using deep neural networks. However, the state-of-the-art generative methods simply treat the document title and the document main body equally, ignoring the leading role of the title to the overall document. To solve this problem, we introduce a new model called Title-Guided Network (TG-Net) for automatic keyphrase generation task based on the encoder-decoder architecture with two new features: (i) the title is additionally employed as a query-like input, and (ii) a title-guided encoder gathers the relevant information from the title to each word in the document. Experiments on a range of KG datasets demonstrate that our model outperforms the state-of-the-art models with a large margin, especially for documents with either very low or very high title length ratios.

研究动机与目标

  • 为解决现有生成式关键词模型将标题与正文同等对待的局限性,忽略标题的总结性作用。
  • 通过显式利用标题作为查询来引导正文编码,提升关键词生成性能。
  • 提升对现有和缺失关键词预测的性能,尤其针对标题极短或极长的文档。
  • 探究标题引导编码是否能更好地捕捉标题与关键词之间的语义相关性。

提出的方法

  • 模型采用双门控循环单元(GRU)编码器:一个用于正文,一个用于标题,两者均生成上下文表征。
  • 基于注意力的匹配层计算每个上下文词与标题之间的相关性,使标题信息能够引导上下文词的编码。
  • 通过额外的双向GRU层,将原始上下文表征与标题注意力表征拼接,形成标题引导的表征。
  • 解码器同时使用注意力机制和复制机制,从预定义词汇表生成关键词,并可直接从源文本复制短语。
  • 将标题视为类似查询的输入,使模型能够聚焦于与标题相关的正文内容,无论其在文本中的距离远近。
  • 模型在五个基准数据集上端到端训练,使用交叉熵损失进行序列生成。

实验结果

研究问题

  • RQ1与标准编码器-解码器模型相比,将标题视为类似查询的输入是否能提升关键词生成性能?
  • RQ2标题引导编码在标题长度比例极端的文档中对关键词生成有何影响?
  • RQ3标题引导注意力在生成文本中未明确出现的缺失关键词方面,提升程度如何?
  • RQ4当与标题引导编码结合时,解码器中引入复制机制是否能进一步提升性能?

主要发现

  • 与最佳基线相比,TG-Net 在最大数据集上,现有关键词预测的 F1@10 提升 9.4%,缺失关键词预测的 Recall@50 提升 19.1%。
  • 模型在标题长度比例低于 3% 和高于 12% 的文档中性能提升最大,此时标题信息对长上下文或短标题尤为关键。
  • 消融实验表明,若移除标题引导编码组件,性能显著下降,证明其在现有和缺失关键词生成中的关键作用。
  • 复制机制对性能贡献显著,其移除导致所有任务的 F1 和召回率均急剧下降。
  • 案例研究显示,TG-Net 成功生成了如 'time-delay systems' 这类缺失关键词,通过利用标题中的提示如 'stochastic delay systems',而 CopyRNN 则失败。
  • 该模型在全部五个基准数据集上持续优于强基线模型,展现出在多种文档类型中的鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。