[论文解读] MDERank: A Masked Document Embedding Rank Approach for Unsupervised Keyphrase Extraction
MDERank 提出了一种新颖的无监督关键词提取方法,通过在文档中屏蔽候选关键词并测量原始文档与屏蔽后文档之间的嵌入相似性,来改进基于相似度的排序。该方法实现了最先进性能,相较于 SIFRank,F1@15 提升了 3.53 分,其优势源于采用了 KPE 优化的 BERT 模型(KPEBERT)和对比预训练。
Keyphrase extraction (KPE) automatically extracts phrases in a document that provide a concise summary of the core content, which benefits downstream information retrieval and NLP tasks. Previous state-of-the-art (SOTA) methods select candidate keyphrases based on the similarity between learned representations of the candidates and the document. They suffer performance degradation on long documents due to discrepancy between sequence lengths which causes mismatch between representations of keyphrase candidates and the document. In this work, we propose a novel unsupervised embedding-based KPE approach, Masked Document Embedding Rank (MDERank), to address this problem by leveraging a mask strategy and ranking candidates by the similarity between embeddings of the source document and the masked document. We further develop a KPE-oriented BERT (KPEBERT) model by proposing a novel self-supervised contrastive learning method, which is more compatible to MDERank than vanilla BERT. Comprehensive evaluations on six KPE benchmarks demonstrate that the proposed MDERank outperforms state-of-the-art unsupervised KPE approach by average 1.80 $F1@15$ improvement. MDERank further benefits from KPEBERT and overall achieves average 3.53 $F1@15$ improvement over the SOTA SIFRank. Our code is available at \url{https://github.com/LinhanZ/mderank}.
研究动机与目标
- 为解决无监督关键词提取中因文档与关键词候选长度差异导致的短语-文档相似度方法性能下降问题。
- 通过确保原始文档与屏蔽文档序列长度可比,提高语义相似度计算的可靠性。
- 通过利用屏蔽文档中的上下文嵌入,增强关键词候选的表示,保留更丰富的上下文信息以用于相似度匹配。
- 通过自监督对比学习,开发一种针对关键词提取任务定制的领域特定预训练语言模型(KPEBERT)。
- 在多种数据集上展示鲁棒性和优越性能,尤其在长文档上,此前方法表现不佳。
提出的方法
- MDERank 采用屏蔽文档嵌入排序策略:在源文档中屏蔽候选关键词,并计算原始版本与屏蔽版本之间的语义相似度。
- 该方法根据原始文档与屏蔽文档嵌入之间相似度的增加对关键词候选进行排序——相似度越低,表示关键词越重要。
- 采用基于 BERT 的编码器生成上下文嵌入,选择最后一层以获得最优语义表示。
- 提出一种新颖的自监督对比学习目标,用于预训练 KPEBERT,通过无监督 KPE 方法生成的伪标签来优化其在关键词提取任务上的表现。
- 使用 YAKE 和 TextRank 等方法生成的伪标签数据对模型进行微调,以提升泛化能力和鲁棒性。
- 在 BERT 各层上评估平均池化(AvgPooling)和最大池化(MaxPooling)策略,以确定 MDERank 最优的嵌入聚合方式。
实验结果
研究问题
- RQ1在文档中屏蔽关键词候选是否能提高无监督关键词提取中语义相似度测量的可靠性?
- RQ2使用屏蔽文档嵌入作为关键词重要性的代理,是否优于直接的短语-文档相似度匹配?
- RQ3自监督对比学习目标能否提升预训练语言模型在关键词提取任务上的性能?
- RQ4用于生成伪标签的无监督 KPE 方法选择,如何影响 KPE 优化 BERT 模型(KPEBERT)的性能?
- RQ5MDERank 在不同长度的文档和关键词长度下是否保持鲁棒性,尤其是在长文档上?
主要发现
- MDERank 在六个基准测试上平均比之前的最先进无监督方法 SIFRank 提升 1.80 F1@15。
- 当与 KPEBERT 结合时,MDERank 在平均 F1@15 上相比 SIFRank 提升 3.53,表明该方法与优化模型之间存在显著协同效应。
- 使用 YAKE 作为 KPEBERT 预训练阶段的伪标签生成器,在短文档和长文档上均表现更优,尤其在长文档上优势明显。
- 在 MDERank 中,最后一层 BERT 始终优于早期层,表明深层上下文表示能显著提升性能。
- 在 MDERank 和 EmbedRank 中,MaxPooling 均表现逊于 AvgPooling,且 MDERank 对更强池化和更深层的依赖更明显。
- MDERank 对关键词长度变化具有鲁棒性,避免了传统短语-文档相似度方法中对较长短语的偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。