[论文解读] Semi-Supervised Learning for Neural Keyphrase Generation
本文提出了一种用于神经关键短语生成的半监督学习方法,通过利用大规模未标注文档,在标注数据稀缺的情况下提升模型性能。通过使用从无监督提取或自学习中生成的合成关键短语,并采用联合训练关键短语和标题生成的多任务学习框架,该方法显著优于完全监督模型,尤其在低资源设置和跨领域场景下表现突出。
We study the problem of generating keyphrases that summarize the key points for a given document. While sequence-to-sequence (seq2seq) models have achieved remarkable performance on this task (Meng et al., 2017), model training often relies on large amounts of labeled data, which is only applicable to resource-rich domains. In this paper, we propose semi-supervised keyphrase generation methods by leveraging both labeled data and large-scale unlabeled samples for learning. Two strategies are proposed. First, unlabeled documents are first tagged with synthetic keyphrases obtained from unsupervised keyphrase extraction methods or a selflearning algorithm, and then combined with labeled samples for training. Furthermore, we investigate a multi-task learning framework to jointly learn to generate keyphrases as well as the titles of the articles. Experimental results show that our semi-supervised learning-based methods outperform a state-of-the-art model trained with labeled data only.
研究动机与目标
- 解决神经关键短语生成中因标注数据有限而导致的性能受限问题,特别是在低资源领域中。
- 探索半监督学习方法,利用大量未标注文档来提升关键短语生成性能,而无需人工标注。
- 研究未标注数据是否能增强模型在跨领域场景下的泛化能力和性能,包括跨领域迁移能力。
- 评估即使在大规模标注数据可用的情况下,半监督方法的有效性,以检验其可扩展性和鲁棒性。
- 设计一种多任务学习框架,联合训练关键短语生成和标题生成任务,以利用未标注数据中的共享表征。
提出的方法
- 使用如TF-IDF和TextRank等无监督方法,为未标注文档生成合成关键短语。
- 应用自学习算法,对未标注数据中的合成关键短语预测进行迭代优化和扩展。
- 在包含标注样本和带有合成关键短语的文档的混合数据集上预训练序列到序列模型。
- 仅在标注数据上微调预训练模型,以适应目标任务。
- 设计一个多任务学习框架,其中关键短语生成(在标注数据上)和标题生成(在未标注数据上)共享同一编码器。
- 通过联合目标端到端训练模型,以提升表征学习和泛化能力,实现共享上下文理解。
实验结果
研究问题
- RQ1当与有限标注数据结合时,从无监督方法中提取的合成关键短语是否能有效提升神经关键短语生成性能?
- RQ2是否联合从未标注文档中学习关键短语和标题生成的多任务学习框架,能优于仅使用监督训练的方法?
- RQ3所提出的半监督方法在跨领域设置下效果如何,例如在科学论文上进行训练,但用于新闻文章的关键短语生成?
- RQ4当已有大规模标注数据集时,未标注数据是否仍能提升性能?
- RQ5所提出的方法在生成输入文档中不存在的关键短语方面,提升程度如何?
主要发现
- 在五个科学论文数据集上,该半监督方法显著优于最先进的监督模型(Meng et al., 2017),F1@5和F1@10得分分别提升了最高0.039和0.046。
- 在KP20k数据集上,多任务学习方法取得了最高的F1@5得分0.328和F1@10得分0.264,显著优于基线seq2seq-copy模型(p < 0.01)。
- 在DUC新闻文章数据集上,使用科学论文进行训练但通过未标注新闻数据进行微调的模型,其F1得分优于仅使用监督训练的基线模型,证明了跨领域泛化能力。
- 即使在拥有130K标注对的情况下,引入400K未标注文档仍带来了可测量的性能提升,涵盖现有和缺失关键短语的生成,Recall@10最高提升了0.046。
- 基于自学习的合成关键短语生成方法在所有合成关键短语策略中表现最佳,在Inspec数据集上F1@5达到0.321。
- 结果表明,未标注数据能持续提升模型泛化能力,即使在资源丰富的设置下也是如此,表明所提出的半监督框架具有广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。