[논문 리뷰] Accurate Protein Structure Prediction by Embeddings and Deep Learning Representations
이 논문은 아미노산 서열에서 단백질 3차 구조를 예측하기 위해 먼저 임bedding을 사용하여 프로테인의 뼈대 원자 간의 거리 행렬과 토텐 각도를 추정한 후, 최적화를 통해 3차원 좌표를 복원하고 전체 원자 구조를 재구성하는 딥러닝 프레임워크를 제시한다. 이는 CASP13에서 최신 기술 수준을 달성하였으며, CASP12 수상자들을 뛰어넘었으며, 공개된 데이터, 모델, 코드를 제공한다.
Proteins are the major building blocks of life, and actuators of almost all chemical and biophysical events in living organisms. Their native structures in turn enable their biological functions which have a fundamental role in drug design. This motivates predicting the structure of a protein from its sequence of amino acids, a fundamental problem in computational biology. In this work, we demonstrate state-of-the-art protein structure prediction (PSP) results using embeddings and deep learning models for prediction of backbone atom distance matrices and torsion angles. We recover 3D coordinates of backbone atoms and reconstruct full atom protein by optimization. We create a new gold standard dataset of proteins which is comprehensive and easy to use. Our dataset consists of amino acid sequences, Q8 secondary structures, position specific scoring matrices, multiple sequence alignment co-evolutionary features, backbone atom distance matrices, torsion angles, and 3D coordinates. We evaluate the quality of our structure prediction by RMSD on the latest Critical Assessment of Techniques for Protein Structure Prediction (CASP) test data and demonstrate competitive results with the winning teams and AlphaFold in CASP13 and supersede the results of the winning teams in CASP12. We make our data, models, and code publicly available.
연구 동기 및 목표
- 아미노산 서열에서 단백질 구조 예측을 위한 딥러닝 기반 방법을 개발하는 것.
- 학습 및 평가용으로 사용할 수 있는 포괄적이고 접근 가능한 황금 표준 데이터셋(CUProtein)을 구축하는 것.
- 공동진화 특징, PSSMs, 다중 서열 정렬을 통합된 프레임워크에서 활용하여 기존 방법을 향상시키는 것.
- 거리 행렬과 토텐 각도 예측 이후 에너지 기반 최적화를 통해 고정밀도의 3차원 구조 복원을 가능하게 하는 것.
- 계산 생물학 연구의 진입 장벽을 낮추기 위해 데이터, 모델, 코드를 공개하는 것.
제안 방법
- 이 방법은 아미노산 서열, PSSMs, 다중 서열 정렬 특징로부터 뼈대 원자 간의 거리 행렬과 토텐 각도를 예측하기 위해 딥러닝을 사용한다.
- 기하학적 및 물리적 에너지 제약 조건을 최소화하는 비선형 최적화 문제를 풀어 3차원 뼈대 좌표를 복원한다.
- phi/psi 각도를 평균값의 룩업 테이블을 사용해 초기화하고, 결합, 라마찬드란, 토텐 항목을 포함한 에너지 최소화를 통해 전체 원자 구조를 생성한다.
- 예측된 토텐 각도가 천연 단백질 각도의 비대칭 분포에서 벗어나면 비틀림의 역전을 적용한다.
- 회전체 라이브러리를 사용해 측쇄를 추가하고, 충돌은 반복적인 에너지 최소화를 통해 해결한다.
- 이 프레임워크는 약 75,000개의 단백질로 구성된 새로운 데이터셋에서 훈련되었으며, 서열, 2차 구조, 공진화 특징, 실험적으로 결정된 3차원 좌표를 포함한다.
실험 결과
연구 질문
- RQ1진화적 및 서열 특징을 기반으로 훈련된 딥러닝 모델이 높은 정확도로 단백질 뼈대 원자 간의 거리 행렬과 토텐 각도를 예측할 수 있는가?
- RQ2기하학적 최적화를 통해 예측된 거리 행렬과 토텐 각도로부터 신뢰성 있게 3차원 뼈대 좌표를 복원할 수 있는가?
- RQ3에너지 최적화 함수를 최적화하여 뼈대 좌표에서 고정밀도의 전체 원자 단백질 구조를 재구성할 수 있는가?
- RQ4이 방법의 성능가 최신 기술 수준의 접근 방식인 AlphaFold 및 CASP 수상 팀들과 비교해 어떻게 되는가?
- RQ5포괄적이고 개방된 데이터셋의 가용성이 단백질 구조 예측 연구의 재현 가능성과 접근성에 얼마나 기여하는가?
주요 결과
- 이 방법은 CASP13에서 수상 팀들과 경쟁 가능한 성능을 보였으며, 선택된 타겟에서 평균 RMSD가 1.60 Å로 최상위 성능을 달성했다.
- CASP12 타겟에서 이 방법은 수상 팀의 결과를 뛰어넘었으며, 평균 RMSD가 1.31 Å로 최고 팀의 1.35 Å보다 우수했다.
- 도전적인 T1003 타겟(CASP13)에서 이 방법은 2.95 Å RMSD를 기록했으며, AlphaFold A7D 모델의 2.12 Å 결과를 뛰어넘었다.
- 여러 개의 CASP13 타겟에서 2 Å 이하의 RMSD를 달성했으며, T0951에서는 1.01 Å, T1006에서는 0.58 Å로 매우 높은 정확도를 보였다.
- 클라우드 GPU 인스턴스에서 훈련은 약 2일이 소요되었고, 추론(거리 및 토텐 예측)은 단일 단백질당 몇 초가량이 소요되었다.
- 전체 원자 재구성 파이프라인(에너지 최소화 및 측쇄 배치 포함)은 단백질 길이에 따라 몇 분이 소요되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.