[论文解读] Scientific Language Models for Biomedical Knowledge Base Completion: An Empirical Study
本文提出将科学语言模型(LMs)与知识图谱嵌入(KGE)模型结合,用于生物医学知识库补全,采用可学习路由机制动态选择LM与KGE的预测结果。该方法在基线模型上实现了13%至36%的相对MRR提升,并在未见过的科学实体上展现出优异的泛化能力,凸显了文本与图谱模态在药物-疾病关联预测中的互补优势。
Biomedical knowledge graphs (KGs) hold rich information on entities such as diseases, drugs, and genes. Predicting missing links in these graphs can boost many important applications, such as drug design and repurposing. Recent work has shown that general-domain language models (LMs) can serve as "soft" KGs, and that they can be fine-tuned for the task of KG completion. In this work, we study scientific LMs for KG completion, exploring whether we can tap into their latent knowledge to enhance biomedical link prediction. We evaluate several domain-specific LMs, fine-tuning them on datasets centered on drugs and diseases that we represent as KGs and enrich with textual entity descriptions. We integrate the LM-based models with KG embedding models, using a router method that learns to assign each input example to either type of model and provides a substantial boost in performance. Finally, we demonstrate the advantage of LM models in the inductive setting with novel scientific entities. Our datasets and code are made publicly available.
研究动机与目标
- 探究领域特定的科学语言模型是否能够提升生物医学知识图谱补全性能。
- 评估语言模型与知识图谱嵌入模型在预测药物-疾病KG中缺失链接时的互补优势。
- 开发并评估一种基于路由的融合方法,通过在LM与KGE预测之间进行选择以提升性能。
- 展示LM在归纳设定下的实用性,即在训练期间未见过的实体。
- 发布数据集与代码,以支持生物医学KG补全的可复现性与未来研究。
提出的方法
- 在富含文本实体描述的生物医学KG上微调领域特定的科学LM(如PubMedBERT、BioBERT)。
- 在相同KG上训练知识图谱嵌入模型(如ComplEx、DKRL),以学习结构化表示。
- 实现一个可学习路由机制,根据输入特征将每个输入三元组分配给LM或KGE模型,从而提升预测准确率。
- 采用最近邻策略,结合冻结或微调的LM,替换KGE模型中未见实体的嵌入表示,实现归纳推理。
- 通过路由机制融合两种模态的预测结果,性能优于简单的平均或早期融合方法。
- 构建三个以药物和疾病为中心的生物医学KG,通过科学文献中的描述丰富实体信息。
实验结果
研究问题
- RQ1科学语言模型能否有效捕捉并利用潜在的生物医学知识以实现知识库补全?
- RQ2语言模型的预测是否在预测能力与泛化性能方面与知识图谱嵌入模型形成互补?
- RQ3一种可学习的路由机制,能够根据输入在LM与KGE预测之间进行选择,是否优于固定集成策略?
- RQ4语言模型在训练期间未见过的新型生物医学实体上泛化能力如何?
- RQ5实体描述与文本多样性在提升链接预测性能方面起到何种作用?
主要发现
- 基于路由的科学语言模型与知识图谱嵌入融合方法,在三个生物医学KG上实现了13%至36%的相对MRR提升。
- 微调后的PubMedBERT(KG-PubMedBERT)优于通用KGE模型(如DKRL),在Hetionet上实现21%的相对MRR提升,在RepoDB上提升超过2倍。
- 使用冻结的PubMedBERT通过最近邻策略替换未见实体嵌入,性能可与DKRL相当或更优,证明了LM在归纳链接预测中的实用性。
- 该方法在RepoDB(MRR 38.8)与Hetionet(MRR 21.6)上均表现优异,H@3与H@10指标显著提升。
- 对于名称复杂或非直观的实体(如P2RY14),语言模型表现更优,其文本描述有助于消歧与预测优化。
- 路由模型通常优于LM与KGE预测的简单平均,表明动态选择比固定融合更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。