QUICK REVIEW
[论文解读] Applying a Generic Sequence-to-Sequence Model for Simple and Effective Keyphrase Generation
Md Faisal Mahbub Chowdhury, Gaetano Rossiello|arXiv (Cornell University)|Jan 14, 2022
Advanced Text Analysis Techniques被引用 12
一句话总结
本文提出了一种简单但高效的关键词生成系统,采用微调后的BART模型,无需定制架构或复杂训练流程。尽管结构简单,该方法在五个关键词基准测试中均达到或超越了当前最先进水平,证明标准预训练模型仅通过极少调整即可媲美甚至超越专门设计的KPG系统。
ABSTRACT
In recent years, a number of keyphrase generation (KPG) approaches were proposed consisting of complex model architectures, dedicated training paradigms and decoding strategies. In this work, we opt for simplicity and show how a commonly used seq2seq language model, BART, can be easily adapted to generate keyphrases from the text in a single batch computation using a simple training procedure. Empirical results on five benchmarks show that our approach is as good as the existing state-of-the-art KPG systems, but using a much simpler and easy to deploy framework.
研究动机与目标
- 探究通用序列到序列模型(如BART)是否可在无需专用架构或训练范式的情况下有效生成关键词。
- 评估单一微调后的BART模型在多个关键词基准测试中的泛化能力。
- 通过采用基于标准NLP实践的统一可部署框架,简化关键词生成流程,替代复杂且任务特定的模型。
- 证明默认超参数与最少微调即可获得与当前最先进KPG系统相媲美甚至更优的结果。
提出的方法
- 在Kp20K数据集上使用标准序列到序列训练流程对BART-large和BART-base进行微调,未进行领域特定预处理。
- 采用One2Seq训练范式,将关键词完整列表作为训练目标序列。
- 推理阶段使用束搜索(beam search)生成关键词,束宽默认为20,每篇文档生成10个关键词。
- 应用标准分词(以空白字符分割)和标点符号规范化,以减少评估阶段的短语匹配错误。
- 使用标准指标进行评估:F-score@5和F-score@10用于已存在关键词,Recall@10用于不存在关键词。
- 在未进一步微调或调整超参数的情况下,直接将同一微调后的模型应用于其他四个基准测试(Inspec、NUS、SemEval、Krapivin)。
实验结果
研究问题
- RQ1通用序列到序列模型(如BART)是否可在无需架构特化的情况下实现具有竞争力的关键词生成性能?
- RQ2单一微调后的BART模型是否可在无需重新训练的情况下有效泛化至多样化的关键词基准测试?
- RQ3与采用复杂架构和定制训练策略的最先进KPG模型相比,简单BART基系统的表现如何?
- RQ4BART基模型在不存在关键词生成方面的主要失败模式是什么,特别是在不存在关键词比例较高的数据集中?
- RQ5默认超参数与最少预处理是否可产生与经过大量调优和任务特定设计的系统相媲美甚至更优的结果?
主要发现
- BART-large模型在五个基准测试中的三个实现了SOTA的F-score@10,Krapivin数据集上达到13.2%的Recall@10,优于先前方法。
- BART-base模型在所有基准测试中均表现具有竞争力,包括Kp20K数据集上6.1%的Recall@10和Inspec数据集上5.4%的Recall@10,展现出强大的泛化能力。
- 与真实标签相比,该模型生成的不存在关键词数量显著更少(SemEval数据集上平均为2.05 vs 8.36),表明召回仍是主要挑战。
- 人工分析显示,58%的生成不存在关键词为假阴性,通常由冗余标记重复(如'malmalware'或'pairpairwise')导致。
- 尽管在SemEval的不存在关键词上表现不佳,但64%的生成不存在关键词被人工标注者判定为正确,表明模型捕捉到了有意义的语义模式。
- 该方法证明,复杂KPG专用设计并非必需,仅通过最少调优的标准序列到序列模型即可实现与SOTA性能相当甚至更优的结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。