Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing the Protein Tertiary Structure Prediction by Multiple Sequence Alignment Generation

Le Zhang, Jiayang Chen|arXiv (Cornell University)|2023. 06. 02.
Protein Structure and Dynamics인용 수 6
한 줄 요약

이 논문은 저품질의 다중 서열 정렬(MSA)을 개선하기 위해 새로운 진화적으로 일관된 단백질 서열을 생성하는 트랜스포머 기반 생성 모델인 MSA-Augmenter를 소개한다. 새로 생성된 서열로 얕은 MSA를 보완함으로써, 특히 동족 서열 수가 적은 경우에 알파폴드2(AlphaFold2)의 단백질 삼차 구조 예측 정확도가 크게 향상되며, CASP14 벤치마크에서 최신 기술 수준의 성능 향상을 보였다.

ABSTRACT

The field of protein folding research has been greatly advanced by deep learning methods, with AlphaFold2 (AF2) demonstrating exceptional performance and atomic-level precision. As co-evolution is integral to protein structure prediction, AF2's accuracy is significantly influenced by the depth of multiple sequence alignment (MSA), which requires extensive exploration of a large protein database for similar sequences. However, not all protein sequences possess abundant homologous families, and consequently, AF2's performance can degrade on such queries, at times failing to produce meaningful results. To address this, we introduce a novel generative language model, MSA-Augmenter, which leverages protein-specific attention mechanisms and large-scale MSAs to generate useful, novel protein sequences not currently found in databases. These sequences supplement shallow MSAs, enhancing the accuracy of structural property predictions. Our experiments on CASP14 demonstrate that MSA-Augmenter can generate de novo sequences that retain co-evolutionary information from inferior MSAs, thereby improving protein structure prediction quality on top of strong AF2.

연구 동기 및 목표

  • 동족 서열이 부족하여 다중 서열 정렬(MSA)이 얕아질 경우 단백질 삼차 구조 예측 정확도가 떨어지는 문제를 해결하기 위해.
  • 낮은 깊이의 MSA를 풍부하게 하기 위해 생물학적으로 타당하고 공진화적으로 일관된 단백질 서열을 생성하는 방법을 개발하기 위해.
  • 생성된 서열을 추가적인 진화 정보로 통합하여 후속 구조 예측 성능을 향상시키기 위해.
  • 생성된 서열이 MSA 품질과 구조 예측 정확도를 향상시키는 데 효과적인지 평가하고, 특히 동족 서열 수가 적은 어려운 케이스에서의 성능을 분석하기 위해.
  • pLDDT가 생성된 MSA에서 최상의 결과를 선택하는 데 신뢰할 수 있는 기준인지 조사하고, 더 나은 필터링 전략을 탐색하기 위해.

제안 방법

  • MSA-Augmenter는 단일 입력 MSA에서 병렬로 다수의 동족 단백질 서열을 생성하도록 훈련된 서열에서 서열로의 트랜스포머 모델이다.
  • 모델은 입력 MSA로부터의 전역적인 구조적 및 진화적 정보를 인코딩하기 위해 단백질 전용 자기주의 메커니즘을 사용한다.
  • 200만 개의 단백질 MSA로 구성된 대규모 데이터셋에서 마스크된 언어 모델링 사전 훈련 목표를 사용하여 공진화 패턴을 학습한다.
  • 생성된 서열은 원본 MSA에 추가되어 향상된 정렬을 생성하고, 이는 알파폴드2의 구조 예측을 위한 입력으로 사용된다.
  • 다중 생성 결과를 통합하는 앙상블 전략을 통해 정확도와 고성능 출력의 선택 정확도를 향상시킨다.
  • 모델은 깊이 50 미만인 CASP14 MSA를 사용하여 평가되며, 일반적으로 성능이 저하되는 경우에 집중된다.
Figure 1: Procedure overview. A low-quality MSA is introduced into the encoder as the source input, from which the decoder concurrently generates multiple homologous sequences. Subsequently, these sequences are appended to the low-quality MSA to create an enhanced MSA, which is then supplied to the
Figure 1: Procedure overview. A low-quality MSA is introduced into the encoder as the source input, from which the decoder concurrently generates multiple homologous sequences. Subsequently, these sequences are appended to the low-quality MSA to create an enhanced MSA, which is then supplied to the

실험 결과

연구 질문

  • RQ1생성 모델이 저품질 MSA를 향상시키고 삼차 구조 예측 정확도를 향상시키는 데 진화적으로 일관된 단백질 서열을 생성할 수 있는가?
  • RQ2MSA-Augmenter의 성능은 깊이가 다른 MSA에서 어떻게 달라지며, 특히 동족 서열 수가 적은 경우에 어떻게 되는가?
  • RQ3생성된 MSA 중에서 최상의 MSA를 선택하는 데 pLDDT 점수가 신뢰할 수 있는 기준인가?
  • RQ4이 방법은 얕은 MSA를 가진 도전적인 CASP14 타겟에서 알파폴드2의 성능을 크게 향상시킬 수 있는가?
  • RQ5앙상블 생성 및 선택 전략이 최종 예측 정확도에 어떤 영향을 미치는가?

주요 결과

  • MSA-Augmenter는 깊이가 얕은 CASP14 타겟에서 단백질 구조 예측 정확도를 크게 향상시키며, 특히 동족 서열 수가 10개 미만인 경우에 두드러진 효과를 보였다.
  • T1093-D1(MSA 깊이 2)에서 평균 LDDT 점수는 25.27점 향상되어 가장 도전적인 케이스에서 강력한 향상을 보였다.
  • T1096-D1(MSA 깊이 7)에서는 증강 후 LDDT 점수가 9.27점 향상되어 낮은 깊이의 MSA에서 일관된 성능 향상을 입증했다.
  • 연구 결과 pLDDT가 신뢰할 수 없는 선택 기준임을 확인했으며, 실제 LDDT 향상과 반대 방향으로 상관관계를 보일 수 있으며, 높은 pLDDT 점수를 가진 경우에도 성능 저하가 발생하는 사례가 있었다.
  • 실제 LDDT 점수(비pLDDT) 기반으로 최상의 MSA를 선택했을 때는 잠재력이 여전히 남아 있음을 확인했으며, 더 나은 필터링 전략을 통해 성능 향상을 더욱 이룰 수 있음을 시사했다.
  • 모델의 성능은 매우 얕은 MSA(MSA 깊이 < 10)에서 가장 효과적이며, 중간 깊이의 MSA(10 < 깊이 < 50)에서는 수익 감소 현상이 나타나는데, 이는 사전 훈련 데이터와의 분포 이탈 때문일 가능성이 높다.
Figure 2: MSA-Augmenter overview (Top) Architecture and Pipeline and Module Attention Operations; (Bottom) Attention mechanism. In representing a single position, the red star denotes the query, while the red boxes signify keys and values for attention processing and computation.
Figure 2: MSA-Augmenter overview (Top) Architecture and Pipeline and Module Attention Operations; (Bottom) Attention mechanism. In representing a single position, the red star denotes the query, while the red boxes signify keys and values for attention processing and computation.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.