Skip to main content
QUICK REVIEW

[论文解读] OntoProtein: Protein Pretraining With Gene Ontology Embedding

Ningyu Zhang, Zhen Bi|arXiv (Cornell University)|Jan 23, 2022
Machine Learning in Bioinformatics被引用 49
一句话总结

OntoProtein 将 Gene Ontology 知识整合到蛋白质预训练中,通过将蛋白质 MLM 目标与知识嵌入联合优化,使用 ProteinKG25 知识图谱,以提升蛋白质功能预测、PPI 和 TAPE 任务。

ABSTRACT

Self-supervised protein language models have proved their effectiveness in learning the proteins representations. With the increasing computational power, current protein language models pre-trained with millions of diverse sequences can advance the parameter scale from million-level to billion-level and achieve remarkable improvement. However, those prevailing approaches rarely consider incorporating knowledge graphs (KGs), which can provide rich structured knowledge facts for better protein representations. We argue that informative biology knowledge in KGs can enhance protein representation with external knowledge. In this work, we propose OntoProtein, the first general framework that makes use of structure in GO (Gene Ontology) into protein pre-training models. We construct a novel large-scale knowledge graph that consists of GO and its related proteins, and gene annotation texts or protein sequences describe all nodes in the graph. We propose novel contrastive learning with knowledge-aware negative sampling to jointly optimize the knowledge graph and protein embedding during pre-training. Experimental results show that OntoProtein can surpass state-of-the-art methods with pre-trained protein language models in TAPE benchmark and yield better performance compared with baselines in protein-protein interaction and protein function prediction. Code and datasets are available in https://github.com/zjunlp/OntoProtein.

研究动机与目标

  • 将来自 Gene Ontology 的外部生物学知识融入蛋白质预训练,以丰富蛋白质表示。
  • 开发一个框架,联合优化蛋白质序列建模和知识图谱嵌入。
  • 创建并发布 ProteinKG25,一个与蛋白质序列和 GO 描述对齐的大规模知识图谱用于预训练。
  • 在下游蛋白任务如功能预测、PPI 和 TAPE 基准上展示改进。

提出的方法

  • 使用混合编码器:ProtBert 处理蛋白质,基于 PubMedBERT 的 GO 描述,并为 GO 关系加入额外的关系编码器。
  • 使用掩码蛋白质建模(MLM)预测被掩盖的氨基酸,初始化自 ProtBert。
  • 将知识图谱以实体(蛋白质和 GO 术语)和关系表示;使用 TransE 风格得分函数 d(h,t)=||h+r−t|| 来应用知识嵌入目标(KE)。
  • 引入与知识相关的负采样以为 KE 构建困难负样本,包括通过替换同一 GO 方面内的叶节点来产生 GO-GO 负样本,以及通过用同源蛋白替换蛋白来产生 Protein-GO 负样本(未来工作)。
  • 以加权目标函数联合优化 KE 和 MLM: ell = alpha * ell_KE + ell_MLM。

实验结果

研究问题

  • RQ1将 GO 基于知识图谱引入到蛋白质预训练是否能超越标准 PLMs 提高下游蛋白理解任务?
  • RQ2使用 GO 关系和知识相关负采样的知识嵌入能否为蛋白质预训练中的 MLM 提供互补信号?
  • RQ3OntoProtein 在转导和归纳设置下在 TAPE、PPI 和蛋白质功能预测上的表现如何?

主要发现

  • OntoProtein 在 TAPE 任务上在令牌级别的表现高于若干基线,包括 ProtBert 和 TAPE Transformer。
  • 在蛋白质-蛋白质相互作用预测中,OntoProtein 优于若干基线,并与 GNN-PPI 方法具有竞争力,尤其是在较小数据集上。
  • 对于蛋白质功能预测,OntoProtein 在转导设置(特别是在 BPO)显示改进,并在其他 GO 方面维持具竞争力的结果,讨论了一些尾部约束问题。
  • OntoProtein 通过增加训练目标和知识整合,在不改变模型架构的情况下提供具竞争力的结果。
  • 作者发布 ProteinKG25,一个具有 612,483 实体和 4,990,097 条三元组的大规模 KG,与 GO 术语和蛋白质序列对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。