[논문 리뷰] Predicting mutational effects on protein-protein binding via a side-chain diffusion probabilistic model
사이드체인Diff은 단백질 인터페이스에서 사이드 체인 컨포메이션을 학습하는 확산 기반 모델로, 결합에 대한 돌연변이 영향 ΔΔG를 예측하여 SKEMPI2 및 SARS-CoV-2 데이터셋에서 최첨단 성능을 달성하고, DiffAffinity가 SidechainDiff 표현을 활용해 결합 변화 예측 및 항체 최적화에 사용합니다.
Many crucial biological processes rely on networks of protein-protein interactions. Predicting the effect of amino acid mutations on protein-protein binding is vital in protein engineering and therapeutic discovery. However, the scarcity of annotated experimental data on binding energy poses a significant challenge for developing computational approaches, particularly deep learning-based methods. In this work, we propose SidechainDiff, a representation learning-based approach that leverages unlabelled experimental protein structures. SidechainDiff utilizes a Riemannian diffusion model to learn the generative process of side-chain conformations and can also give the structural context representations of mutations on the protein-protein interface. Leveraging the learned representations, we achieve state-of-the-art performance in predicting the mutational effects on protein-protein binding. Furthermore, SidechainDiff is the first diffusion-based generative model for side-chains, distinguishing it from prior efforts that have predominantly focused on generating protein backbone structures.
연구 동기 및 목표
- 유한한 라벨 데이터 속에서 단백질-단백질 결합에 미치는 돌연변이 효과를 정확히 예측하는 것을 목표로 한다.
- 인터페이스에 있는 단백질 사이드 체인에 대한 확산 기반 생성 모델을 개발한다.
- 돌연변이의 구조적 맥락 표현을 학습하여 ΔΔG 예측을 향상시킨다.
- 학습된 표현의 항체 최적화 및 SARS-CoV-2 관련 작업에 대한 활용성을 보여준다.
제안 방법
- SidechainDiff 도입, SE(3)-불변 구조 맥락에 조건화된 4D 토러스(T^4) 위의 사이드-체인 로타머를 위한 조건부 리만 확산 모델.
- 앞으로의 확산을 T^4에서의 지오메트릭 랜덤 워크로 모델링하고, 점수 함수 s_theta(X,t,Z)를 MLP로 학습하며, Z는 돌연변이 맥락을 인코딩한다.
- 조건 인코더(SE(3)-불변 IPA 네트워크)를 사용하여 per-residue 및 쌍 구조 특징으로부터 Z를 생성한다.
- De Bortoli 등(2022)의 암시적 손실에 따른 점수 기반 확산에 따라 정제된 PDB-REDO 구조로 SidechainDiff를 학습한다.
- DiffAffinity를 사이드체인Diff 임베딩을 사용해 ΔΔG를 예측하는 다운스트림 예측기로 정의하고, IPA 유사 트랜스포머와 MLP 헤드를 사용한다.
실험 결과
연구 질문
- RQ1확산 기반 모델이 인터페이스에서 단백질 사이드 체인 컨포메이션의 생성 분포를 학습할 수 있는가?
- RQ2학습된 사이드 체인 표현이 기존 방법들과 비교해 단백질-단백질 결합에 대한 돌연변이 효과 ΔΔG 예측의 정확성을 향상시키는가?
- RQ3SidechainDiff 표현이 항체 최적화 및 SARS-CoV-2 결합 예측과 같은 다운스트림 작업에 유익한가?
주요 결과
- DiffAffinity는 SKEMPI2에서 다수 지표에 대해 최첨단 성능을 달성하며, 에너지 기반, 시퀀스 기반, 비지도, 엔드투엔드 및 사전 학습 베이스라인을 능가한다.
- 단일 및 다중 지점 돌연변이에서 DiffAffinity 및 DiffAffinity*가 베이스라인을 능가하고, SidechainDiff 표현으로 DiffAffinity가 약간 더 우수하다.
- SARS-CoV-2 RBD 돌연변이에서 DiffAffinity는 15개 중요한 위치와 285개의 단일 포인트 돌연변이에 대해 타 방법보다 더 높은 피어슨 상관계수를 보인다.
- DiffAffinity는 유리한 돌연변이를 순위화하여 항체 최적화를 향상시키며 상위 돌연변이 순위에서 FoldX, RDE-Net 및 DiffAffinity*를 지속적으로 능가한다.
- SidechainDiff는 기저 대비 공간 충돌 수가 더 낮고 딥러닝 방법 대비 MAE가 유리한 것으로 사이드 체인 로타머 예측에서 경쟁력 있는 성능을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.