Skip to main content
QUICK REVIEW

[논문 리뷰] Protein-DNA binding sites prediction based on pre-trained protein language model and contrastive learning

Yufan Liu, Boxue Tian|arXiv (Cornell University)|2023. 06. 28.
RNA and protein synthesis mechanisms인용 수 5
한 줄 요약

이 논문은 사전 훈련된 단백질 언어 모델과 대비 학습을 통합하여 단백질-DNA 결합 잔여물을 예측하는 새로운 딥러닝 프레임워크 CLAPE-DB를 제안한다. 자기지도 학습 표현 학습과 단백질 서열에서의 대비 사전 훈련을 활용함으로써, CLAPE-DB는 두 개의 벤치마크 데이터셋에서 AUC 점수 0.871과 0.881을 기록하여 기존 방법들보다 정확도와 일반화 능력에서 뛰어난 성능을 보였다.

ABSTRACT

Protein-DNA interaction is critical for life activities such as replication, transcription, and splicing. Identifying protein-DNA binding residues is essential for modeling their interaction and downstream studies. However, developing accurate and efficient computational methods for this task remains challenging. Improvements in this area have the potential to drive novel applications in biotechnology and drug design. In this study, we propose a novel approach called CLAPE, which combines a pre-trained protein language model and the contrastive learning method to predict DNA binding residues. We trained the CLAPE-DB model on the protein-DNA binding sites dataset and evaluated the model performance and generalization ability through various experiments. The results showed that the AUC values of the CLAPE-DB model on the two benchmark datasets reached 0.871 and 0.881, respectively, indicating superior performance compared to other existing models. CLAPE-DB showed better generalization ability and was specific to DNA-binding sites. In addition, we trained CLAPE on different protein-ligand binding sites datasets, demonstrating that CLAPE is a general framework for binding sites prediction. To facilitate the scientific community, the benchmark datasets and codes are freely available at https://github.com/YAndrewL/clape.

연구 동기 및 목표

  • 단백질-DNA 결합 잔여물을 더 정확하고 일반화 능력이 뛰어난 계산적 방법을 개발하기 위해.
  • 단백질-DNA 상호작용에서 레이블이 부족한 데이터와 복잡한 서열-구조 관계에 도전하기 위해.
  • 자기지도 사전 훈련과 대비 학습을 활용하여 결합 부위 예측을 위한 표현 학습을 향상시키기 위해.
  • DNA 결합 외에도 다른 리간드 결합 부위에 적용 가능한 일반화 가능한 프레임워크를 만들기 위해.

제안 방법

  • 모델은 단백질 서열을 맥락 기반 임bedding으로 인코딩하기 위해 사전 훈련된 단백질 언어 모델(예: ESM 또는 유사 모델)을 사용한다.
  • 대비 학습은 양성 및 음성 서열 뷰를 대조하여 구분 가능한 표현을 학습하기 위해 적용된다.
  • 양성 쌍은 데이터 증강(예: 무작위 마스킹 또는 노이즈 주입)을 통해 생성되고, 음성 쌍은 다른 단백질 서열들로부터 형성된다.
  • 모델은 단백질-DNA 결합 데이터셋에서 엔드 투 엔드로 미세조정되어 결합 잔여물을 예측한다.
  • 대비 손실 함수는 훈련 중에 양성 쌍을 가까이 모으고 음성 쌍을 멀리 떼어내도록 모델을 유도한다.
  • 최종 모델인 CLAPE-DB는 AUC 및 AUPRC와 같은 표준 지표를 사용하여 벤치마크 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1대비 학습은 DNA 결합 잔여물 예측을 위한 단백질 서열의 표현 학습을 향상시킬 수 있는가?
  • RQ2CLAPE-DB는 표준 벤치마크 데이터셋에서 기존 최첨단 모델들과 비교해 성능가능한가?
  • RQ3제안된 프레임워크는 DNA 외의 다른 리간드 결합 부위로도 잘 일반화되는가?
  • RQ4이 맥락에서 사전 훈련된 단백질 언어 모델과 대비 학습을 통합했을 때 기여도는 어떠한가?
  • RQ5CLAPE-DB는 서열 데이터의 변동성과 데이터 희소성에 대해 얼마나 강건한가?

주요 결과

  • CLAPE-DB는 첫 번째 벤치마크 데이터셋에서 AUC 0.871을 기록하여 뛰어난 예측 성능를 입증했다.
  • 두 번째 벤치마크 데이터셋에서는 AUC 0.881을 달성하여 높은 정확도와 강건성을 보였다.
  • 제한된 레이블이 부여된 데이터 조건에서도 기존 방법들보다 뛰어난 일반화 능력을 보였다.
  • 프레임워크는 단백질-리간드 결합 부위 예측으로 성공적으로 확장되어, 다양한 종류의 결합 유형으로의 일반화 가능성을 확인했다.
  • 사전 훈련된 언어 모델과 대비 학습을 통합함으로써 결합 부위 예측을 위한 표현 학습이 크게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.