Skip to main content
QUICK REVIEW

[논문 리뷰] DeepGATGO: A Hierarchical Pretraining-Based Graph-Attention Model for Automatic Protein Function Prediction

Zihao Li, Changkun Jiang|arXiv (Cornell University)|2023. 07. 24.
Bioinformatics and Genomic Networks인용 수 5
한 줄 요약

DeepGATGO는 단백질 서열 임베딩에 ESM-1b를, 유전자 온톨로지(GO) 어휘의 의미적 표현에 BioBERT를 활용하고, 대비 학습을 통한 그래프 자기주도 네트워크(GATs)를 사용하여 유전자 온톨로지(GO) 어휘의 계층적 구조를 포착하는 계층적이고 서열 중심의 모델이다. 이 모델은 구조적 또는 상호작용 데이터가 필요 없이도 CAFA3 및 TALE 데이터셋에서 최신 기술 수준의 성능을 달성하며, 다양한 생물 종에 걸쳐 뛰어난 확장성과 일반화 능력을 보여준다.

ABSTRACT

Automatic protein function prediction (AFP) is classified as a large-scale multi-label classification problem aimed at automating protein enrichment analysis to eliminate the current reliance on labor-intensive wet-lab methods. Currently, popular methods primarily combine protein-related information and Gene Ontology (GO) terms to generate final functional predictions. For example, protein sequences, structural information, and protein-protein interaction networks are integrated as prior knowledge to fuse with GO term embeddings and generate the ultimate prediction results. However, these methods are limited by the difficulty in obtaining structural information or network topology information, as well as the accuracy of such data. Therefore, more and more methods that only use protein sequences for protein function prediction have been proposed, which is a more reliable and computationally cheaper approach. However, the existing methods fail to fully extract feature information from protein sequences or label data because they do not adequately consider the intrinsic characteristics of the data itself. Therefore, we propose a sequence-based hierarchical prediction method, DeepGATGO, which processes protein sequences and GO term labels hierarchically, and utilizes graph attention networks (GATs) and contrastive learning for protein function prediction. Specifically, we compute embeddings of the sequence and label data using pre-trained models to reduce computational costs and improve the embedding accuracy. Then, we use GATs to dynamically extract the structural information of non-Euclidean data, and learn general features of the label dataset with contrastive learning by constructing positive and negative example samples. Experimental results demonstrate that our proposed model exhibits better scalability in GO term enrichment analysis on large-scale datasets.

연구 동기 및 목표

  • 희귀하거나 정확도가 떨어지는 구조적 또는 상호작용 데이터에 의존하는 기존 단백질 기능 예측 방법의 한계를 해결하기 위해.
  • 단백질 서열만을 사용하여 대규모 다중 레이블 GO 어휘 예측 성능을 향상시키기 위해.
  • 그래프 자기주도 기반 기법을 활용하여 GO 어휘의 계층적 비유클리드적 구조를 효과적으로 모델링하기 위해.
  • GO 어휘 임베딩에 대한 대비 학습을 통해 특징 표현을 향상시켜 다양한 생물 종 간 일반화 능력을 향상시키기 위해.
  • 잘 annotation된 단백질 서열뿐 아니라 희소하게 annotation된 서열에서도 잘 작동하는 확장성 있고 일반화된 모델을 개발하기 위해.

제안 방법

  • 단백질 아미노산 서열에서 문맥적 임베딩을 계산하기 위해 ESM-1b를 사용한다.
  • 유전자 온톨로지(GO) 어휘의 의미적 임베딩을 생성하기 위해 BioBERT를 적용한다.
  • 부모-자식 관계를 기반으로 GO 어휘의 방향성 있는 비순환 그래프(DAG)를 구성하여 계층적 구조를 모델링한다.
  • 여러 개의 주의 메커니즘 헤드를 갖춘 그래프 자기주도 네트워크(GATs)를 활용하여 GO 어휘 간의 동적 구조적 의존성을 학습한다.
  • GO 어휘 임베딩의 양성 및 음성 쌍을 구성함으로써 대비 학습을 도입하여 표현 학습을 향상시킨다.
  • 가장자기 주의 메커니즘을 통해 서열과 GO 어휘 표현을 융합하며, 구조적 정보와 의미적 정보를 균형 잡기 위한 학습 가능한 초수치 δ를 사용한다.

실험 결과

연구 질문

  • RQ1구조적 또는 상호작용 데이터에 의존하지 않고 단백질 서열만을 사용하여 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2그래프 자기주도 네트워크는 비유클리드적이고 DAG 기반의 레이블 공간에서 유전자 온톨로지(GO) 어휘의 계층적 구조를 얼마나 효과적으로 포착할 수 있는가?
  • RQ3기능 예측을 위한 GO 어휘 표현에서 구조적(GAT 기반)과 의미적(BioBERT 기반) 정보의 최적의 균형은 무엇인가?
  • RQ4대비 학습은 다중 레이블 단백질 기능 예측에서 GO 어휘 임베딩의 일반화 능력과 강건성을 얼마나 향상시키는가?
  • RQ5GAT 레이어의 주의 헤드 수가 성능에 미치는 영향은 어느 정도이며, 확장성과 정확도를 고려할 때 최적의 구성은 무엇인가?

주요 결과

  • CAFA3 데이터셋을 사용하여 MFO 도메인에서 최대 F1 스코어 0.617, BPO에서 0.528, CCO에서 0.679를 기록하며 이전의 서열 중심 모델들을 능가한다.
  • 모델 성능은 δ = 0.5 또는 0.6일 때 최고로 나타나, GAT에서 유도된 구조적 정보가 정확도 향상에 의미적으로 더 큰 기여를 한다는 것을 시사한다.
  • GAT 레이어에서 8개의 주의 헤드를 사용할 경우 최적의 성능를 달성하며, 이 이상일 경우 수익 감소와 함께 변동성이 증가한다.
  • 대비 학습은 관련이 있는 GO 어휘와 관련이 없는 어휘를 구분하는 능력을 크게 향상시켜 다양한 생물 종 간 일반화 능력을 향상시킨다.
  • 모델는 뛰어난 확장성과 일반화 능력을 보이며, 잘 annotation된(CAFA3) 및 희소하게 annotation된(TALE) 데이터셋 모두에서 잘 작동한다.
  • 미리 학습된 서열 및 GO 어휘 임베딩의 통합은 계산 비용을 줄이고 동시에 임베딩 품질과 예측 정확도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.