[论文解读] OAG-BERT: Towards A Unified Backbone Language Model For Academic Knowledge Services
OAG-BERT 是一种在开放学术图谱(OAG)上预训练的统一实体增强语言模型,整合了异构学术实体(如论文、作者、会议)与科学文本。它在九项学术 NLP 任务上达到最先进性能,包括会议预测和标题生成等零样本推理任务,展现出强大的泛化能力,并成功应用于国家自然科学基金(NSFC)评审人推荐与 AMiner 系统的现实部署。
Academic knowledge services have substantially facilitated the development of the science enterprise by providing a plenitude of efficient research tools. However, many applications highly depend on ad-hoc models and expensive human labeling to understand scientific contents, hindering deployments into real products. To build a unified backbone language model for different knowledge-intensive academic applications, we pre-train an academic language model OAG-BERT that integrates both the heterogeneous entity knowledge and scientific corpora in the Open Academic Graph (OAG) -- the largest public academic graph to date. In OAG-BERT, we develop strategies for pre-training text and entity data along with zero-shot inference techniques. In OAG-BERT, we develop strategies for pre-training text and entity data along with zero-shot inference techniques. Its zero-shot capability furthers the path to mitigate the need of expensive annotations. OAG-BERT has been deployed for real-world applications, such as the reviewer recommendation function for National Nature Science Foundation of China (NSFC) -- one of the largest funding agencies in China -- and paper tagging in AMiner. All codes and pre-trained models are available via the CogDL toolkit.
研究动机与目标
- 解决学术知识应用对临时定制模型和昂贵人工标注数据的依赖问题。
- 开发一种统一的、预训练的语言模型,整合异构学术实体知识与科学文本。
- 实现下游学术任务的零样本推理,以降低标注成本。
- 通过单一通用主干模型支持多样化的学术知识服务。
- 在真实系统中部署该模型,如 NSFC 评审人推荐与 AMiner。
提出的方法
- 在包含 7 亿多个实体和 20 亿多条关系、1.1 亿篇摘要与 500 万篇全文的开放学术图谱(OAG)上预训练 OAG-BERT。
- 引入实体类型嵌入以区分不同类型的实体(如作者、会议、研究领域)。
- 设计一种基于实体长度的跨度感知实体掩码策略,在掩码语言建模过程中掩码连续的标记跨度。
- 提出一种实体感知的二维位置编码,以建模实体内部的标记顺序与实体之间的序列顺序。
- 对会议预测、隶属关系预测和研究领域标注等任务应用基于提示的零样本推理。
- 采用标记对数概率之和进行实体预测,并在编码器模型中采用无序解码以获得更优性能。
实验结果
研究问题
- RQ1在异构学术知识与文本上预训练的统一语言模型,是否能在多样化的学术 NLP 任务上超越特定任务的模型?
- RQ2使用 OAG-BERT 进行零样本推理在会议、隶属关系和研究领域预测等实体预测任务中效果如何?
- RQ3引入实体感知位置编码与跨度感知掩码在实体丰富的学术任务中对模型性能的提升程度如何?
- RQ4OAG-BERT 是否能在无需任务特定微调的情况下,良好泛化至多个学术知识服务?
- RQ5OAG-BERT 在真实应用场景(如评审人推荐与论文标注)中的表现如何?
主要发现
- OAG-BERT 在九项学术知识密集型任务上达到最先进性能,包括姓名消歧、文献检索与论文推荐。
- 模型展现出强大的零样本能力,人工评估显示 47.6% 的 OAG-BERT 生成标题与原始人工撰写标题无法区分。
- 使用标记对数概率之和进行实体预测优于平均值方法,表明其与模型置信度得分更具一致性。
- 无序解码在编码器模型(如 OAG-BERT 和 SciBERT)中优于从左到右的解码方式,性能更优。
- OAG-BERT 已成功部署于真实系统,包括 NSFC 评审人推荐与 AMiner,证实其实际应用价值。
- 该模型已通过 CogDL 工具包发布,使研究社区能够广泛访问并复用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。