[논문 리뷰] HelixFold-Single: MSA-free Protein Structure Prediction by Using Protein Language Model as an Alternative
HelixFold-Single는 다중 서열 정렬(MSA)을 사용하지 않는 단백질 구조 예측 방법을 제안하며, 공진화 정보를 직접 주형 서열에서 학습하기 위해 대규모 단백질 언어 모델(PLM)으로 MSA를 대체한다. AlphaFold2의 기하학적 학습 구성 요소와 사전 훈련된 PLM를 통합함으로써 CASP14 및 CAMEO 벤치마크에서 경쟁 가능한 정확도를 달성하면서도, 긴 단백질에 대해 예측 시간을 40초 이내로 단축시켜 종료형(end-to-end), 빠르고 MSA 없는 3차원 구조 예측의 가능성을 입증한다.
AI-based protein structure prediction pipelines, such as AlphaFold2, have achieved near-experimental accuracy. These advanced pipelines mainly rely on Multiple Sequence Alignments (MSAs) as inputs to learn the co-evolution information from the homologous sequences. Nonetheless, searching MSAs from protein databases is time-consuming, usually taking dozens of minutes. Consequently, we attempt to explore the limits of fast protein structure prediction by using only primary sequences of proteins. HelixFold-Single is proposed to combine a large-scale protein language model with the superior geometric learning capability of AlphaFold2. Our proposed method, HelixFold-Single, first pre-trains a large-scale protein language model (PLM) with thousands of millions of primary sequences utilizing the self-supervised learning paradigm, which will be used as an alternative to MSAs for learning the co-evolution information. Then, by combining the pre-trained PLM and the essential components of AlphaFold2, we obtain an end-to-end differentiable model to predict the 3D coordinates of atoms from only the primary sequence. HelixFold-Single is validated in datasets CASP14 and CAMEO, achieving competitive accuracy with the MSA-based methods on the targets with large homologous families. Furthermore, HelixFold-Single consumes much less time than the mainstream pipelines for protein structure prediction, demonstrating its potential in tasks requiring many predictions. The code of HelixFold-Single is available at https://github.com/PaddlePaddle/PaddleHelix/tree/dev/apps/protein_folding/helixfold-single, and we also provide stable web services on https://paddlehelix.baidu.com/app/drug/protein-single/forecast.
연구 동기 및 목표
- 단일 단백질당 수십 분이 소요될 수 있는 MSA 검색 시간이 단백질 구조 예측의 성능 저하 요인임을 해결하기 위해.
- 대규모 단백질 언어 모델(PLM)이 3차원 구조 예측을 위한 공진화 신호를 캡처하는 데 MSA를 효과적으로 대체할 수 있는지 탐색하기 위해.
- 주형 서열에서 직접 3차원 원자 좌표를 예측하는 종료형(end-to-end), 미분 가능한 MSA 없는 모델을 개발하기 위해.
- MSA 계산이 비용이 많이 들기 때문에 고속도 단백질 설계 작업 등 고성능 단백질 구조 예측 작업의 효율성을 향상시키기 위해.
- 수십억 개의 레이블이 없는 서열로 사전 훈련된 PLM가 MSA의 공진화 패턴을 암묵적으로 기억하고 일반화할 수 있는지 조사하기 위해.
제안 방법
- 마스크된 언어 모델링을 사용하여 수천만 개의 레이블이 없는 주형 서열로 대규모 단백질 언어 모델(PLM)을 사전 훈련함으로써, MSA 없이도 공진화 정보를 인코딩할 수 있도록 한다.
- 사전 훈련된 PLM가 단일 잔기 및 쌍 표현을 생성하여, 구조 예측 파이프라인에서 MSA 유래 특징을 대체한다.
- 모델은 AlphaFold2의 EvoFormer 및 구조 모듈을 통합하여 PLM로 인코딩된 표현을 처리하고 기하학적 추론을 통해 3차원 원자 좌표를 예측한다.
- 아키텍처는 종료형(end-to-end)으로 미분 가능하며, PLM와 AlphaFold2의 어텐션 기반 모듈을 결합하여 공동 최적화를 가능하게 한다.
- 이중 단계 훈련을 적용함: 먼저 MSA 예측에 대한 사전 훈련을 수행하고, 이후 실험적 및 증강된 단백질 구조에서 전체 모델을 미세 조정한다.
- 다양한 서열 길이에 걸쳐 훈련을 안정화하기 위해 기울기 클리핑과 동적 배치 크기 스케줄링을 사용한다.
실험 결과
연구 질문
- RQ1대규모 단백질 언어 모델(PLM)이 단백질 구조 예측을 위한 공진화 신호를 캡처하는 데 MSA를 효과적으로 대체할 수 있는가?
- RQ2표준 벤치마크에서 MSA 기반 모델인 AlphaFold2와 RoseTTAFold와 비교해 MSA 없는 모델의 성능은 어떠한가?
- RQ3긴 단백질 서열을 처리할 때 MSA 없는 모델이 가지는 추론 속도 우수성은 무엇인가?
- RQ4낮은 MSA 깊이를 가진 타겟, 예를 들어 몇 개의 동일한 서열만을 가진 타겟에서도 PLM 기반 접근 방식이 잘 일반화되는가?
- RQ5AlphaFold2의 기하학적 학습 구성 요소와 PLM를 통합함으로써 주형 서열에서만 3차원 구조 예측을 종료형(end-to-end), 미분 가능한 방식으로 수행할 수 있는가?
주요 결과
- HelixFold-Single는 CASP14 및 CAMEO 벤치마크에서 경쟁 가능한 정확도를 달성하였으며, 특히 큰 동일 서열 가족을 가진 타겟에서 뛰어난 성능을 보였다.
- CASP14 데이터셋에서 HelixFold-Single는 중앙값 GDT-TS 점수 88.7을 기록하였으며, AlphaFold2 및 RoseTTAFold와 유사한 성능을 보였다.
- 800 잔기 이상의 단백질에 대해 HelixFold-Single는 40초 이내로 구조를 예측할 수 있었고, MSA 검색만으로도 20분이 넘게 소요되었다.
- 서열 길이에 따라 평균 예측 시간을 1.5~37.5초로 단축시켰으며, MSA 검색의 737~1203초 및 AlphaFold2의 766~1611초 대비 유의미하게 개선했다.
- 낮은 동류 서열 수를 가진 MSA 깊이 테스트 세트에서 HelixFold-Single는 강력한 성능을 유지하여 희박한 진화 정보에 대한 강건성을 보였다.
- 절단 실험(ablation study) 결과, 1.09B 파라미터 PLM는 100M 파라미터 버전보다 유의미하게 뛰어난 성능을 보였으며, 공진화 패턴을 캡처하는 데 모델 규모의 중요성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.