Skip to main content
QUICK REVIEW

[논문 리뷰] A Systematic Study of Joint Representation Learning on Protein Sequences and Structures

Zuobai Zhang, Wang, Chuanrui|arXiv (Cornell University)|2023. 03. 11.
Machine Learning in Bioinformatics인용 수 26
한 줄 요약

이 논문은 단백질 언어 모델(ESM-2)과 구조 인코더(GVP, GearNet, CDConv)를 세 가지 융합 전략과 여섯 가지 사전 학습 방법을 사용하여 결합함으로써 단백질 기능 주석 및 구조 관련 작업에서 최첨단 성능을 달성하는 것을 연구한다.

ABSTRACT

Learning effective protein representations is critical in a variety of tasks in biology such as predicting protein functions. Recent sequence representation learning methods based on Protein Language Models (PLMs) excel in sequence-based tasks, but their direct adaptation to tasks involving protein structures remains a challenge. In contrast, structure-based methods leverage 3D structural information with graph neural networks and geometric pre-training methods show potential in function prediction tasks, but still suffers from the limited number of available structures. To bridge this gap, our study undertakes a comprehensive exploration of joint protein representation learning by integrating a state-of-the-art PLM (ESM-2) with distinct structure encoders (GVP, GearNet, CDConv). We introduce three representation fusion strategies and explore different pre-training techniques. Our method achieves significant improvements over existing sequence- and structure-based methods, setting new state-of-the-art for function annotation. This study underscores several important design choices for fusing protein sequence and structure information. Our implementation is available at https://github.com/DeepGraphLearning/ESM-GearNet.

연구 동기 및 목표

  • 시퀀스와 구조 정보를 통합하여 효과적인 공동 단백질 표현 학습의 동기를 부여하고 이를 가능하게 한다.
  • PLM과 구조 인코더를 결합하는 세 가지 융합 전략(직렬, 병렬, 교차)을 체계적으로 비교한다.
  • 알파폴드 데이터베이스 사전 학습을 포함하여 라벨이 없는 시퀀스와 구조 데이터의 활용을 위한 여섯 가지 사전 학습 기법을 평가한다.
  • EC, GO 및 구조 관련 작업(PSR, MSP)에서 성능 향상을 시연한다.

제안 방법

  • 최첨단 PLM(ESM-2)과 세 가지 구조 인코더(GVP, GearNet, CDConv)를 사용한다.
  • 세 가지 융합 방식 소개: 직렬 융합(구조 인코더 입력이 PLM 출력에서 초기화), 병렬 융합(시퀀스와 구조 표현을 연결), 교차 융합(모달 간의 교차 어텐션).
  • 학습 중 PLM의 학습률을 감소시켜 사전 학습된 표현을 보호한다.
  • AlphaFold 데이터베이스의 라벨이 없는 데이터를 사용하여 잔류 유형, 거리, 각도, 이면각, 다중 뷰 대조, SiamDiff를 포함한 여섯 가지 목표로 공동 인코더를 사전 학습한다.
  • 여섯 가지 사전 학습 방법 탐색: 잔류 유형 예측, 거리 예측, 각도 예측, 이면각 예측, 다중 뷰 대조, SiamDiff(확산 기반).
  • EC, GO(BP/MF/CC), PSR, MSP 작업에서 단백질 중심 F-max, AUROC, 및 Spearman 상관계수를 사용하여 평가하고 SOTA 베이스라인과 비교한다.

실험 결과

연구 질문

  • RQ1PLM과 구조 인코더를 결합하는 것이 단일 모달리티 모델보다 단백질 기능 및 구조 작업에서 더 성능이 우수한가?
  • RQ2어떤 융합 전략이 작업 전반에 걸쳐 이중 모드 시퀀스-구조 정보를 가장 잘 활용하는가?
  • RQ3함수 및 구조 예측을 위한 공동 시퀀스-구조 표현을 가장 잘 강화하는 사전 학습 목표는 무엇인가?
  • RQ4구조 인코더와 함께 공동 학습할 때 PLM 표현을 보존하는 것이 얼마나 중요한가?
  • RQ5공동 표현이 EC 및 GO 주석에서 새로운 SOTA 성능을 달성하는가?

주요 결과

  • 직렬 융합은 대부분의 작업에서 다른 융합 전략을 일관되게 능가한다.
  • PLM 학습률을 낮추는 것은 망각을 방지하고 성능 향상을 유지하는 데 중요하다.
  • GearNet은 단독으로는 약하지만 PLM과의 통합으로 특히 EC 및 GO 작업에서 크게 이익을 얻는다.
  • 시퀀스와 구조 목표를 모두 포함한 공동 사전 학습이 어느 한 모달리티만 사용하는 것보다 더 나은 성능을 낸다.
  • Multiview Contrast와 SiamDiff가 최상위 사전 학습 방법으로 부상하며, Multiview Contrast는 기능 주석에, SiamDiff는 구조 관련 작업에 도움을 준다.
  • 제안된 ESМ-GearNet 접근법은 Enzyme Commission 및 Gene Ontology 주석 작업에서 새로운 최첨단 성능을 달성하고, PSR 및 MSP에서 경쟁력 있는 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.