Skip to main content
QUICK REVIEW

[论文解读] An Integrated Approach for Keyphrase Generation via Exploring the Power of Retrieval and Extraction

Wang Chen, Hou Pong Chan|arXiv (Cornell University)|Apr 6, 2019
Advanced Text Analysis Techniques参考文献 36被引用 5
一句话总结

本文提出了一种集成式关键词生成框架,通过多任务学习统一了抽取式、生成式和基于检索的方法。通过联合训练抽取式模型以优化生成式模型的复制机制,并检索相似文档作为外部知识,该方法提升了关键词预测性能。一个神经合并模块对所有来源的输出进行重排序,实现了在五个基准测试上的最先进性能,Krapivin数据集上的F1@10得分最高达到0.250。

ABSTRACT

In this paper, we present a novel integrated approach for keyphrase generation (KG). Unlike previous works which are purely extractive or generative, we first propose a new multi-task learning framework that jointly learns an extractive model and a generative model. Besides extracting keyphrases, the output of the extractive model is also employed to rectify the copy probability distribution of the generative model, such that the generative model can better identify important contents from the given document. Moreover, we retrieve similar documents with the given document from training data and use their associated keyphrases as external knowledge for the generative model to produce more accurate keyphrases. For further exploiting the power of extraction and retrieval, we propose a neural-based merging module to combine and re-rank the predicted keyphrases from the enhanced generative model, the extractive model, and the retrieved keyphrases. Experiments on the five KG benchmarks demonstrate that our integrated approach outperforms the state-of-the-art methods.

研究动机与目标

  • 解决纯抽取式或生成式关键词生成方法的局限性,这些方法无法捕捉缺失的关键词或缺乏全局上下文。
  • 通过从训练数据中检索的相似文档引入外部知识,改进关键词生成性能。
  • 利用抽取式模型提供的静态重要性分数,改进生成式模型的复制机制,以更好地识别关键内容。
  • 设计一个统一框架,通过可学习的合并模块整合抽取、生成与检索的输出,实现最终排序。
  • 通过全面的消融实验与评估,在多个基准测试上建立新的最先进方法。

提出的方法

  • 提出一种多任务学习框架,联合训练抽取式序列标注模型与带有复制机制的生成式序列到序列模型。
  • 利用抽取式模型的输出(词级重要性分数)动态调整生成式模型中复制概率分布,提升对关键源词的关注度。
  • 实现一个文档检索模块,通过语义相似度查找语义上相似的训练文档,并将其关联的关键词作为生成解码器的外部记忆。
  • 设计一个基于神经网络的合并模块,从三个来源收集关键词候选:增强的生成输出、抽取式预测结果以及检索到的关键词。
  • 在合并模块中训练一个评分网络,利用生成、抽取与检索得分的特征对候选进行重排序,实现端到端优化。
  • 将所有组件整合为单一统一架构,支持联合优化与推理,提升鲁棒性与覆盖度。

实验结果

研究问题

  • RQ1如何联合优化抽取式与生成式关键词模型,以同时提升现有关键词与缺失关键词的预测性能?
  • RQ2将来自相似文档的检索关键词作为外部知识引入,对关键词生成性能有何影响?
  • RQ3通过可学习的合并模块结合抽取、生成与检索的预测结果,对最终关键词排序与整体性能有何影响?
  • RQ4抽取式模型提供的静态重要性分数能否改善神经生成模型中的复制机制?
  • RQ5抽取、检索与生成各组件对最终关键词预测质量的相对贡献如何?

主要发现

  • 该集成方法在Krapivin基准测试上实现了新的最先进F1@10得分0.250,优于现有方法。
  • 引入检索到的关键词显著提升了现有与缺失关键词的预测性能,当包含检索时,缺失关键词召回率(R@10)从0.166提升至0.172。
  • 合并模块显著提升性能,相比最佳基线(无合并),F1@10提升0.002。
  • 若在合并模块中移除评分器,性能下降,F1@10降至0.248,证明评分器在有效候选重排序中的关键作用。
  • 仅使用评分器进行最终重要性评分(不依赖检索、抽取或生成得分)会导致性能急剧下降(F1@10 = 0.210),表明多源信息整合的必要性。
  • 消融实验证实,检索与抽取组件各自具有独特贡献:抽取提升现有关键词预测,检索增强缺失关键词检测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。