Skip to main content
QUICK REVIEW

[논문 리뷰] Profile Prediction: An Alignment-Based Pre-Training Task for Protein Sequence Models

Pascal Sturmfels, Jesse Vig|arXiv (Cornell University)|2020. 12. 01.
Machine Learning in Bioinformatics참고 문헌 31인용 수 14
한 줄 요약

이 논문은 단일 서열 정렬(MSA)에서 유도된 프로파일 은폐 마크로프 모델(HMM) 방출을 레이블로 사용하는 새로운 프리트레인 태스크인 프로파일 예측을 소개한다. MSA로부터 생물학적으로 타당한 인덕티브 바이어스를 활용함으로써, 이 방법은 구조 및 동일성 예측 태스크에서 마스크된 언어 모델링보다 뛰어난 성능을 보이며, 정렬 기반 프리트레인 태스크가 진화적이고 구조적 예측을 위한 우수한 표현을 제공할 수 있음을 보여준다.

ABSTRACT

For protein sequence datasets, unlabeled data has greatly outpaced labeled data due to the high cost of wet-lab characterization. Recent deep-learning approaches to protein prediction have shown that pre-training on unlabeled data can yield useful representations for downstream tasks. However, the optimal pre-training strategy remains an open question. Instead of strictly borrowing from natural language processing (NLP) in the form of masked or autoregressive language modeling, we introduce a new pre-training task: directly predicting protein profiles derived from multiple sequence alignments. Using a set of five, standardized downstream tasks for protein models, we demonstrate that our pre-training task along with a multi-task objective outperforms masked language modeling alone on all five tasks. Our results suggest that protein sequence models may benefit from leveraging biologically-inspired inductive biases that go beyond existing language modeling techniques in NLP.

연구 동기 및 목표

  • 단백질 과학에서 광범위한 레이블 없는 단백질 서열 데이터와 제한된 레이블 데이터 간의 불균형을 해결한다.
  • 일부 단백질 예측 태스크에서 미미한 성능 향상을 보이는 NLP 기반 프리트레인 태스크(예: 마스크된 언어 모델링)의 한계를 극복한다.
  • 다중 서열 정렬(MSA)에서 유도된 진화 정보를 활용하는 생물학적으로 타당한 프리트레인 목표를 개발한다.
  • 자기지도 학습 프리트레인에 정렬 기반 인덕티브 바이어스를 통합하여 다양한 단백질 예측 태스크의 최종 성능을 향상시킨다.
  • 프로파일 예측이 마스크된 언어 모델링보다 단백질의 구조 및 동일성과 관련된 태스크에서 더 나은 표현을 제공함을 보여준다.

제안 방법

  • 프리트레인 중에 다중 서열 정렬(MSA)에서 유도된 HMM 프로파일을 지도 타겟으로 사용한다.
  • 각 입력 단백질 서열에 대해 데이터베이스 검색(예: PSI-BLAST)을 통해 MSA를 생성한 후, HMM의 매칭 상태 및 삽입 상태의 방출 확률을 계산한다.
  • Transformer 기반 모델을 사용하여 각 아미노산 위치의 HMM 방출 확률을 예측하며, 레이블은 MSA 프로파일에서 유도된다.
  • 예측된 방출 확률과 진짜 방출 확률 간의 KL 발산 손실을 계산하고, 서열 길이 평균을 취한다.
  • 프로파일 예측과 마스크된 언어 모델링을 동시에 최적화하기 위해 다중 태스크 목표를 적용한다.
  • 비교 분석에서 아키텍처, 하이퍼파ram터, 프리트레인 데이터를 동일하게 유지하여 프리트레인 목표의 영향을 정확히 분리한다.

실험 결과

연구 질문

  • RQ1MSA에서 유도된 HMM 프로파일을 예측하는 프리트레인 태스크가 표준 NLP 기반 목표에 비해 단백질 표현 학습을 향상시키는가?
  • RQ2프로파일 예측은 단백질의 구조 및 진화적 관계와 관련된 최종 태스크에서 더 나은 성능을 내는가?
  • RQ3프로파일 예측은 플루오레스센스 및 안정성 예측과 같은 엔지니어링 중심 태스크에서 마스크된 언어 모델링보다 나은가?
  • RQ4프로파일 예측과 마스크된 언어 모델링을 결합하면 다양한 최종 태스크에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ5생물학적으로 유도된 프리트레인 목표가 일반적인 NLP 기반 목표보다 단백질 서열 모델링에서 얼마나 뛰어나게 성능을 냅니까?

주요 결과

  • 프로파일 예측은 모든 다섯 가지 최종 태스크에서 마스크된 언어 모델링을 능가했으며, 특히 2차 구조 예측(0.74 vs. 0.72)과 원거리 동일성 탐지(0.23 vs. 0.14)에서 가장 큰 성과를 보였다.
  • 플루오레스센스 태스크에서 프로파일 예측은 F1 스코어 0.38을 기록하여 마스크된 언어 모델링(0.25)과 다중 태스크 학습(0.28)을 모두 앞섰다.
  • 안정성 태스크에서는 마스크된 언어 모델링과 다중 태스크 모델이 프로파일 예측(0.63 vs. 0.55)을 앞서며, 마스크된 모델링이 미세한 엔지니어링 태스크에 더 적합함을 시사했다.
  • 프로파일 예측은 이전의 단백질 전용 프리트레인 태스크들(예: Bepler & Berger, 2018; Lu et al., 2020)보다 2차 구조 및 원거리 동일성 태스크에서 모두 승리했다.
  • 프로파일 예측과 마스크된 언어 모델링을 조합한 다중 태스크 모델이 가장 뛰어난 종합 성능을 보이며, 두 목표 간의 상호보완적 강점이 있음을 시사했다.
  • 프로파일 예측 모델은 2차 구조 및 동일성 태스크에서 TAPE 벤치마크의 Transformer 및 LSTM 모델을 모두 능가했으며, 유일하게 더 높은 성능을 보인 정렬 기반 베이스라인(0.80 F1)을 제외하고는 모두 앞섰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.