[논문 리뷰] OntoProtein: Protein Pretraining With Gene Ontology Embedding
OntoProtein은 ProteinKG25 지식 그래프를 사용하여 단백질 MLM 목표를 지식 임베딩과 함께 공동 최적화함으로써 단백질 기능 예측, PPI, 및 TAPE 태스크를 향상시킵니다.
Self-supervised protein language models have proved their effectiveness in learning the proteins representations. With the increasing computational power, current protein language models pre-trained with millions of diverse sequences can advance the parameter scale from million-level to billion-level and achieve remarkable improvement. However, those prevailing approaches rarely consider incorporating knowledge graphs (KGs), which can provide rich structured knowledge facts for better protein representations. We argue that informative biology knowledge in KGs can enhance protein representation with external knowledge. In this work, we propose OntoProtein, the first general framework that makes use of structure in GO (Gene Ontology) into protein pre-training models. We construct a novel large-scale knowledge graph that consists of GO and its related proteins, and gene annotation texts or protein sequences describe all nodes in the graph. We propose novel contrastive learning with knowledge-aware negative sampling to jointly optimize the knowledge graph and protein embedding during pre-training. Experimental results show that OntoProtein can surpass state-of-the-art methods with pre-trained protein language models in TAPE benchmark and yield better performance compared with baselines in protein-protein interaction and protein function prediction. Code and datasets are available in https://github.com/zjunlp/OntoProtein.
연구 동기 및 목표
- Gene Ontology로부터의 외부 생물학 지식을 단백질 사전학습에 도입하여 단백질 표현을 풍부하게 한다.
- 프토틴 서열 모델링과 지식 그래프 임베딩을 공동 최적화하는 프레임워크를 개발한다.
- 사전훈련을 위해 단백질 서열과 GO 기술 설명에 맞춘 대규모 KG인 ProteinKG25를 만들어 공개한다.
- 함수 예측, PPI, 그리고 TAPE 벤치마크와 같은 다운스트림 단백질 태스크에서의 개선을 입증한다.
제안 방법
- 하이브리드 인코더를 사용한다: ProtBert를 단백질에, PubMedBERT 기반 GO 설명에 대해, GO 관계에 대한 추가 관계 인코더를 사용한다.
- 마스킹된 단백질 모델링(MLM)을 이용하여 마스킹된 아미노산을 예측하고, ProtBert에서 초기화한다.
- KG를 엔티티(단백질 및 GO 용어)와 관계로 표현하고, TransE 스타일의 점수 함수 d(h,t)=||h+r−t||를 사용하는 지식 임베딩 목표(KE)를 적용한다.
- 같은 GO 측면 내의 잎을 대체하여 GO-GO 음수를 포함한 KE를 위한 Hard Negatives를 구성하고, 단백질을 서로 상동체로 대체하여 Protein-GO 음수를 생성하는 지식 인식 음수 샘플링을 도입한다(향후 연구).
- 가중된 목표로 KE와 MLM을 공동 최적화한다: ell = alpha * ell_KE + ell_MLM.
실험 결과
연구 질문
- RQ1GO 기반 지식 그래프를 단백질 사전학습에 도입하는 것이 표준 PLM보다 다운스트림 단백질 이해 작업을 향상시키는가?
- RQ2GO 관계와 지식 인식 음수 샘플링을 이용한 지식 임베딩이 단백질 사전학습의 MLM에 보완적 신호를 제공하는가?
- RQ3OntoProtein은 트랜스덕티브 및 인덕티브 설정에서 TAPE, PPI, 및 단백질 기능 예측에서 어떻게 성능을 나타내는가?
주요 결과
- OntoProtein은 ProtBert 및 TAPE Transformer 등 여러 기준선보다 TAPE 태스크에서 토큰 수준 성능이 더 높다.
- 단백질-단백질 상호작용 예측에서 OntoProtein은 여러 기준선을 능가하고, 특히 작은 데이터셋에서 GNN-PPI 방법과 경쟁력이 있다.
- 단백질 기능 예측에서 OntoProtein은 트랜스덕티브 설정에서 개선을 보이고(BPO에서 특히), 다른 GO 측면에서도 경쟁력 있는 결과를 유지하며 일부 꼬리 제약에 대한 논의가 있다.
- 모델 아키텍처를 바꾸지 않고도 학습 목표와 지식 반영을 추가하여 경쟁력 있는 결과를 제공한다.
- 저자는 ProteinKG25를 공개하는데, 이는 GO 항목 및 단백질 서열과 정렬된 대규모 KG로 612,483개의 엔티티와 4,990,097개의 삼중항으로 구성되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.