Skip to main content
QUICK REVIEW

[论文解读] Learning Feature Representations for Keyphrase Extraction

Corina Florescu, Wei Jin|arXiv (Cornell University)|Jan 5, 2018
Advanced Text Analysis Techniques被引用 7
一句话总结

该论文提出 SurfKE,一种监督式关键词提取模型,通过将文档表示为词图并利用偏置随机游走学习短语表征,在合成数据集上实现了 0.260 的 SOTA F1 分数,相较于强基线模型 PositionRank 和 Maui,分别在精确率上提升了 15.18% 和 8.91%。

ABSTRACT

In supervised approaches for keyphrase extraction, a candidate phrase is encoded with a set of hand-crafted features and machine learning algorithms are trained to discriminate keyphrases from non-keyphrases. Although the manually-designed features have shown to work well in practice, feature engineering is a difficult process that requires expert knowledge and normally does not generalize well. In this paper, we present SurfKE, a feature learning framework that exploits the text itself to automatically discover patterns that keyphrases exhibit. Our model represents the document as a graph and automatically learns feature representation of phrases. The proposed model obtains remarkable improvements in performance over strong baselines.

研究动机与目标

  • 为解决关键词提取中手工设计特征的局限性,这些特征依赖专家知识且泛化能力差。
  • 自动从文本的结构模式中学习信息丰富、数据驱动的特征表征,而无需依赖人工特征工程。
  • 通过利用词图的拓扑结构并借助偏置随机游走学习分布式节点表征,提升关键词提取性能。
  • 评估基于图结构文本自发现的表征是否能在关键词分类中超越传统手工设计的特征。

提出的方法

  • 该模型从文档构建无向词图,其中顶点为经过词性过滤后的实词,边连接在大小为 w 的滑动窗口内共现的词。
  • 边的权重由词对在窗口内的共现频率定义,以捕捉局部句法和语义关系。
  • 采用偏置随机游走策略生成节点序列,其中转移概率倾向于权重更高的边,从而实现对显著词邻域的探索。
  • 使用类似 skip-gram 的模型在随机游走序列上进行训练,将每个词映射到低维空间中的 d 维向量。
  • 通过将多词候选短语中组成词的向量取平均,形成短语表征。
  • 使用高斯朴素贝叶斯分类器,基于这些学习到的表征对候选短语进行排序和分类,判断其是否为关键词。

实验结果

研究问题

  • RQ1基于图的文本表示能否在无需人工特征工程的情况下,自动发现能区分关键词与非关键词的有意义模式?
  • RQ2在词图上通过偏置随机游走学习分布式表征,是否能带来优于传统手工特征的关键词提取性能?
  • RQ3所提模型在多样化领域中的性能与强监督及无监督基线相比如何?
  • RQ4所学习的表征在多大程度上捕捉了反映文档主要主题的关键、核心术语?

主要发现

  • SurfKE 在合成数据集上实现了 0.260 的 F1 分数,显著优于最佳基线 PositionRank 的 0.240。
  • 与 KEA(0.146)相比,精确率提升 50.68%;与 KPMiner(0.165)相比,提升 33.33%;与 Maui(0.191)相比,提升 15.18%;与 PositionRank(0.202)相比,提升 8.91%。
  • SurfKE 的召回率为 0.390,超过所有基线,表明其在识别相关关键词方面具有优异表现。
  • 结果表明,自发现的基于图的表征在关键词分类任务中比手工设计特征更有效。
  • 模型通过图拓扑成功捕捉了核心术语,这一点在 DUC、Inspec 和 PubMed 等多样化文档类型上的性能提升中得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。