[论文解读] Open Domain Web Keyphrase Extraction Beyond Language Modeling
本文介绍了 OpenKP,一个包含 100,000 篇网络文档及专家标注关键词短语的大规模开放领域关键词提取数据集,并提出了 BLING-KPE 模型。该模型通过整合视觉文档特征和来自搜索点击行为的弱监督信号,超越了传统语言建模方法,在关键词提取方面实现了显著提升。BLING-KPE 显著优于现有方法,并在未见过的领域(如新闻)中展现出强大的零样本泛化能力,甚至优于在科学数据上训练的专用神经网络模型。
This paper studies keyphrase extraction in real-world scenarios where documents are from diverse domains and have variant content quality. We curate and release OpenKP, a large scale open domain keyphrase extraction dataset with near one hundred thousand web documents and expert keyphrase annotations. To handle the variations of domain and content quality, we develop BLING-KPE, a neural keyphrase extraction model that goes beyond language understanding using visual presentations of documents and weak supervision from search queries. Experimental results on OpenKP confirm the effectiveness of BLING-KPE and the contributions of its neural architecture, visual features, and search log weak supervision. Zero-shot evaluations on DUC-2001 demonstrate the improved generalization ability of learning from the open domain data compared to a specific domain.
研究动机与目标
- 为非科学领域中的关键词提取任务解决缺乏大规模、多样化、真实世界网络文档数据集的问题。
- 在内容质量与结构多变、资源有限的网络文档上,提升关键词提取性能。
- 通过利用超越纯语言理解的视觉布局和搜索行为信号,开发一种在不同领域间具有良好泛化能力的模型。
- 证明来自搜索点击日志的弱监督信号与视觉特征,可显著提升开放领域设置下的关键词提取性能。
提出的方法
- 精心构建了 OpenKP 数据集,包含约 100,000 篇来自多样化领域的网络文档,附有专家标注的关键词短语,已公开发布于 aka.ms/BLING。
- 提出了 BLING-KPE 模型,采用卷积 Transformer 架构,联合建模网络文档的语言和视觉特征。
- 将字体大小、位置和 HTML 结构等视觉特征整合到词嵌入中,以捕捉文档布局的显著性。
- 引入了一项预训练任务“查询预测”,利用搜索点击日志在大规模上弱监督关键词的相关性。
- 结合上下文嵌入(如 ELMo)、视觉特征和点击监督,以超越语言建模的方式提升关键词检测性能。
- 在 DUC-2001 的零样本评估中,应用启发式方法(加权求和与去重)将文档分块生成的关键词短语进行合并。
实验结果
研究问题
- RQ1在未见过的领域(如新闻)中,仅在多样化真实网络文档上进行训练的关键词提取模型,是否能在不微调的情况下实现有效泛化?
- RQ2视觉文档特征和搜索点击日志在超越语言建模的关键词提取性能中,贡献程度如何?
- RQ3BLING-KPE 在开放领域和新闻数据集上,与当前最先进的神经和非神经关键词提取方法相比表现如何?
- RQ4在搜索点击日志上进行预训练作为弱监督,是否能提升关键词提取在跨领域的准确性和鲁棒性?
- RQ5在 BLING-KPE 的整体性能中,语言建模、视觉特征和点击监督的相对贡献分别是什么?
主要发现
- BLING-KPE 在 OpenKP 数据集上显著优于标准 KPE 基线模型、近期神经网络模型以及高度优化的商业系统。
- 消融实验表明,若移除视觉特征或搜索点击预训练,模型准确率显著下降,证实了二者在模型中的关键作用。
- 在 DUC-2001 的零样本评估中,基于 OpenKP 训练的 BLING-KPE 模型在 F1@10 指标上达到最高分,优于 TFIDF 和所有其他神经网络模型。
- 在 OpenKP 上训练的模型泛化能力优于在科学领域数据上训练的模型,后者在新闻文档上表现不佳。
- 视觉特征有助于识别出如产品名称和类型等显著短语,这些短语在视觉上被突出显示,即使仅靠语言模型也难以排在前列。
- “查询预测”预训练任务有效利用大规模搜索日志,提供了有意义的监督信号,提升了关键词相关性检测性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。