Skip to main content
QUICK REVIEW

[论文解读] Learning Rich Representation of Keyphrases from Text

Mayank Kulkarni, Debanjan Mahata|arXiv (Cornell University)|Dec 16, 2021
Advanced Text Analysis Techniques被引用 4
一句话总结

本文提出了KBIR,一种用于判别式语言模型的新预训练目标,以及KeyBART,一种微调后的BART设置,用于生成式关键词建模,两者均旨在学习丰富的关键词表征。通过将关键词边界补全和替换分类与掩码语言建模相结合,KBIR在关键词抽取任务上实现了最先进(SOTA)的性能,F1分数最高提升8.16分;KeyBART在关键词生成任务上也达到了SOTA结果,F1@M最高提升4.33分。

ABSTRACT

In this work, we explore how to train task-specific language models aimed towards learning rich representation of keyphrases from text documents. We experiment with different masking strategies for pre-training transformer language models (LMs) in discriminative as well as generative settings. In the discriminative setting, we introduce a new pre-training objective - Keyphrase Boundary Infilling with Replacement (KBIR), showing large gains in performance (upto 8.16 points in F1) over SOTA, when the LM pre-trained using KBIR is fine-tuned for the task of keyphrase extraction. In the generative setting, we introduce a new pre-training setup for BART - KeyBART, that reproduces the keyphrases related to the input text in the CatSeq format, instead of the denoised original input. This also led to gains in performance (upto 4.33 points in F1@M) over SOTA for keyphrase generation. Additionally, we also fine-tune the pre-trained language models on named entity recognition (NER), question answering (QA), relation extraction (RE), abstractive summarization and achieve comparable performance with that of the SOTA, showing that learning rich representation of keyphrases is indeed beneficial for many other fundamental NLP tasks.

研究动机与目标

  • 开发一种预训练目标,以增强语言模型学习关键词特定任务表征的能力。
  • 解决在判别式与生成式NLP设置中,缺乏专为关键词表征学习量身定制的预训练策略的问题。
  • 评估关键词感知的预训练是否不仅能提升关键词相关任务的性能,还能在更广泛的下游NLP任务(如NER、QA和摘要生成)中带来性能提升。
  • 探索关键词表征在其他NLP任务中的可迁移性,证明其在关键词特定目标之外的更广泛应用价值。

提出的方法

  • 提出KBIR,一种多任务预训练目标,结合掩码语言建模(MLM)、关键词边界补全(KBI)和关键词替换分类(KRC),用于判别式模型。
  • 提出KeyBART,一种重新配置的BART预训练设置,模型从损坏输入中生成关键词(以CatSeq格式),而非对原始文本进行去噪。
  • 在包含2300万篇科学论文的大型语料库上训练模型,关键词通过TextRank自动提取,确保广泛的领域覆盖。
  • 在下游任务(包括关键词抽取、关键词生成、NER、QA、关系抽取和抽象式摘要)上对预训练模型进行微调。
  • 在KBIR中采用双阶段训练策略,联合优化词元掩码、边界重建和关键词语义替换。
  • 结合抽取式与抽象式关键词数据进行训练,使模型能够处理存在与不存在关键词的预测任务。

实验结果

研究问题

  • RQ1我们能否设计一种预训练目标,使语言模型在判别式设置下更好地学习关键词表征?
  • RQ2我们能否开发一种生成式预训练设置,通过聚焦于关键词重建而非输入去噪,来提升关键词生成性能?
  • RQ3与现有SOTA方法相比,学习丰富的关键词表征是否能带来关键词抽取与生成任务的性能提升?
  • RQ4关键词感知的表征是否能有效迁移到其他基础NLP任务(如NER、QA和摘要)中?
  • RQ5通过增强对关键主题的语义理解,关键词特定的预训练能否提升抽象式摘要的质量?

主要发现

  • KBIR在关键词抽取任务上达到SOTA性能,在SemEval 2017基准数据集上,F1分数最高较之前SOTA提升8.16分。
  • KeyBART在关键词生成任务上达到SOTA结果,在Inspec数据集上,针对存在关键词的生成任务,F1@M分数较ONE2SEQ模型提升4.33分。
  • 与在相同数据上微调的标准BART相比,采用关键词生成目标训练的模型在所有ROUGE指标(R1、R2、RLSum)上均表现出更高的分数。
  • 在命名实体识别、问答和关系抽取任务上的微调性能与SOTA模型相当,表明关键词表征具有良好的可迁移性。
  • 定性分析显示,当不依赖复制机制时,模型能生成有意义的不存在关键词,如“natural language processing”,表明其具备超越表面匹配的语义理解能力。
  • 关键词抽取任务中,模型表现出更高的召回率,可能归因于通过KRC和KBI目标提升了对关键词边界和语义角色的理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。