[논문 리뷰] EBM-Fold: Fully-Differentiable Protein Folding Powered by Energy-based Models
EBM-Fold는 노이즈가 있는 거리 행렬에서 Cα 원자 좌표의 기울기를 예측하도록 훈련된 노이즈 제거 스코어 네트워크를 사용하여 완전히 미분 가능한 단백질 구조 최적화 방법을 제안한다. 이는 랑주뱅 역학을 통해 엔드 투 엔드로 개선되며, 중규모 데이터셋에서 0.7775의 lDDT-Ca 점수를 기록하여 trRosetta의 0.7452보다 향상되었고, 이완각 조건을 통해 손상된 구조의 수동성 문제를 명시적으로 해결한다.
Accurate protein structure prediction from amino-acid sequences is critical to better understanding the protein function. Recent advances in this area largely benefit from more precise inter-residue distance and orientation predictions, powered by deep neural networks. However, the structure optimization procedure is still dominated by traditional tools, e.g. Rosetta, where the structure is solved via minimizing a pre-defined statistical energy function (with optional prediction-based restraints). Such energy function may not be optimal in formulating the whole conformation space of proteins. In this paper, we propose a fully-differentiable approach for protein structure optimization, guided by a data-driven generative network. This network is trained in a denoising manner, attempting to predict the correction signal from corrupted distance matrices between Ca atoms. Once the network is well trained, Langevin dynamics based sampling is adopted to gradually optimize structures from random initialization. Extensive experiments demonstrate that our EBM-Fold approach can efficiently produce high-quality decoys, compared against traditional Rosetta-based structure optimization routines.
연구 동기 및 목표
- 기존의 Rosetta와 같은 전통적인 도구를 대체할 수 있는 완전히 미분 가능한 단백질 구조 최적화 프레임워크를 개발하는 것.
- 노이즈 제거를 통한 점수 함수 학습을 통해 엔드 투 엔드 훈련 및 최적화를 가능하게 하는 것.
- 데이터 기반 기울기를 사용하여 무작위 초기화된 구조를 정제하여 구조 예측 정확도를 향상시키는 것.
- 독립적인 이완각 기반 모듈을 통해 단백질 구조의 수동성 모호성을 해결하는 것.
- AlphaFold2와 유사한 엔드 투 엔드 단백질 구조 예측 파이프라인의 가능성에 대한 증명
제안 방법
- Cα 좌표에 대한 천연 단백질 구조의 로그 확률 기울기를 추정하기 위해, 노이즈 제거 스코어 매칭을 통해 스코어 네트워크를 훈련한다.
- 네트워크의 입력은 변형된 Cα 좌표에서 유도된 노이즈가 있는 거리 행렬이며, 목표는 진짜 기울기 신호이다.
- 추론 과정에서는 노이즈를 점진적으로 감소시키는 랑주뱅 역학을 사용하여 무작위 초기 구조를 개선하며, 단계 크기는 노이즈 표준편차의 제곱에 비례한다.
- 스코어 네트워크에서 SE(3)-등변 메시지 전파를 적용하여 3차원 회전 및 이동 불변성을 유지한다.
- 수동성 문제 해결 모듈은 이완각 분포를 사용하여 거울상 구조를 수정하여 GDT-TS 점수를 향상시킨다.
- 프레임워크는 약 2000개의 CATH 도메인으로 구성된 중규모 데이터셋에서 훈련되며, lDDT-Ca와 GDT-TS 지표를 사용해 평가된다.
실험 결과
연구 질문
- RQ1완전히 미분 가능한 데이터 기반 스코어 네트워크가 Rosetta와 같은 전통적인 에너지 기반 최적화 도구보다 단백질 구조 정제 성능에서 뛰어나게 될 수 있는가?
- RQ2거리 행렬에 대한 노이즈 제거 스코어 매칭이 임의의 초기 단백질 구조를 효과적이고 안정적으로 정제하는 데 기여하는가?
- RQ3외부 대칭 제약 없이도 모델이 단백질 구조의 수동성 모호성을 해결할 수 있는가?
- RQ4동일한 입력 예측 조건에서 EBM-Fold의 성능이 trRosetta와 같은 최신 기술과 비교해 어떻게 되는가?
- RQ5감소하는 노이즈 스케줄을 가진 랑주뱅 역학 스케줄링이 수렴성과 구조 정확도에 얼마나 기여하는가?
주요 결과
- EBM-Fold는 동일한 테스트 세트에서 trRosetta의 0.7452에서 0.7775로 평균 lDDT-Ca 점수를 향상시켜 더 뛰어난 정제 능력을 입증한다.
- 목표별 최고의 구조를 고려했을 때, EBM-Fold는 0.8124의 lDDT-Ca 점수를 기록했고, trRosetta는 0.8523이었다. 이는 최적화 안정성 향상 여전히 개선이 필요한 분야임을 시사한다.
- GDT-TS 지표는 수동성 문제 해결 모듈이 없을 경우 예측된 구조의 약 50%가 잘못된 수동성을 띠며 GDT-TS 점수를 크게 낮춘다는 것을 드러낸다.
- 수동성 모듈을 활성화한 경우 GDT-TS 점수는 높고 일관되게 유지되며, 이는 거울상 오류 수정에 효과적임을 확인한다.
- 구조 최적화 과정은 일관된 lDDT-Ca 향상을 보이며, 특히 랑주뱅 역학 단계의 첫 2/3 동안 노이즈가 감소하고 단계 크기가 커지면서 두드러진 향상이 관찰된다.
- 이 방법은 계산적으로 효율적이며, 단일 V100 GPU에서 18시간의 훈련 후 300 아미노산 이하 단백질의 경우 예측에 1분 미만이 소요된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.