Skip to main content
QUICK REVIEW

[论文解读] Keyphrase Generation with Correlation Constraints

Jun Chen, Xiaoming Zhang|arXiv (Cornell University)|Aug 22, 2018
Advanced Text Analysis Techniques参考文献 29被引用 8
一句话总结

该论文提出 CorrRNN,一种用于关键词生成的序列到序列模型,通过显式建模多个关键词之间的相关性,利用覆盖机制提升主题覆盖度,利用回顾机制减少重复。该模型通过端到端学习一对一多关键词关系,在基准数据集上显著优于当前最先进方法,在准确率和多样性方面表现更优。

ABSTRACT

In this paper, we study automatic keyphrase generation. Although conventional approaches to this task show promising results, they neglect correlation among keyphrases, resulting in duplication and coverage issues. To solve these problems, we propose a new sequence-to-sequence architecture for keyphrase generation named CorrRNN, which captures correlation among multiple keyphrases in two ways. First, we employ a coverage vector to indicate whether the word in the source document has been summarized by previous phrases to improve the coverage for keyphrases. Second, preceding phrases are taken into account to eliminate duplicate phrases and improve result coherence. Experiment results show that our model significantly outperforms the state-of-the-art method on benchmark datasets in terms of both accuracy and diversity.

研究动机与目标

  • 为解决因忽略关键词之间相关性而导致的自动关键词生成中的重复与覆盖问题。
  • 在序列到序列框架中建模文档与其多个关键词之间的一对多关系。
  • 通过端到端学习相关性约束,同时提升文档主题的覆盖度与生成关键词的多样性。
  • 在生成准确且无冗余关键词方面,超越现有方法,包括启发式规则与先前的 Seq2Seq 模型。

提出的方法

  • 引入一个覆盖向量,用于追踪源文档中已被先前生成的关键词总结的词语,以增强主题覆盖度。
  • 采用回顾机制,将先前生成的关键词融入解码器隐藏状态,以防止重复生成。
  • 在标准 Seq2Seq 架构基础上,引入一种新型注意力机制,显式建模已生成关键词与下一个待生成关键词之间的相关性。
  • 使用复制机制以保留罕见或未登录词,确保生成源文本中未明确出现的关键词。
  • 在单个基于 RNN 的解码器中结合覆盖与回顾机制,以平衡连贯性、覆盖度与多样性。
  • 在文档-关键词对上进行端到端训练,直接从数据中学习相关性约束。

实验结果

研究问题

  • RQ1建模多个关键词之间的相关性是否能提升关键词生成的覆盖度并减少重复?
  • RQ2引入追踪已总结内容的覆盖机制,对生成关键词的主题覆盖度有何影响?
  • RQ3在解码过程中考虑先前生成的关键词,在多大程度上能减少冗余?
  • RQ4端到端学习相关性约束是否优于启发式后处理规则,在关键词多样性与准确率方面表现更优?

主要发现

  • CorrRNN 在基准数据集上的关键词准确率与多样性方面,显著优于当前最先进模型 CopyRNN。
  • 在案例研究中,与 CopyRNN 相比,CorrRNN 额外生成了一个正确的现有关键词与一个缺失的关键词,提升了主题覆盖度。
  • CorrRNN 仅生成两个 'conferencing' 类型的短语,而 CopyRNN 生成了四个,显著提升了结果的连贯性。
  • 尽管参数量更多(94.9M),CorrRNN 的收敛速度更快,性能更优,表明训练效率更高。
  • 实证结果证实,端到端学习相关性约束比启发式规则在提升多样性与准确率方面更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。