[논문 리뷰] Unsupervised Protein-Ligand Binding Energy Prediction via Neural Euler's Rotation Equation
이 논문은 SE(3) 노이즈 제거 스코어 매칭을 사용한 물리학적으로 영감을 받은 등변 회전 예측 네트워크를 갖춘 비지도 방법인 신경 오일러의 회전 방정식(NERE)을 제안한다. NERE는 라벨이 부족한 경우에도 강력한 성능을 보이며, 항체-항원 결합 친화도 예측에서 지도 학습 모델을 뛰어넘는다.
Protein-ligand binding prediction is a fundamental problem in AI-driven drug discovery. Prior work focused on supervised learning methods using a large set of binding affinity data for small molecules, but it is hard to apply the same strategy to other drug classes like antibodies as labelled data is limited. In this paper, we explore unsupervised approaches and reformulate binding energy prediction as a generative modeling task. Specifically, we train an energy-based model on a set of unlabelled protein-ligand complexes using SE(3) denoising score matching and interpret its log-likelihood as binding affinity. Our key contribution is a new equivariant rotation prediction network called Neural Euler's Rotation Equations (NERE) for SE(3) score matching. It predicts a rotation by modeling the force and torque between protein and ligand atoms, where the force is defined as the gradient of an energy function with respect to atom coordinates. We evaluate NERE on protein-ligand and antibody-antigen binding affinity prediction benchmarks. Our model outperforms all unsupervised baselines (physics-based and statistical potentials) and matches supervised learning methods in the antibody case.
연구 동기 및 목표
- 항체와 같이 소분자 외의 리간드에 대해 라벨이 부족한 결합 친화도 데이터 문제를 해결한다. 이 경우 지도 학습은 실용적이지 않다.
- 다양한 리간드 종류에 적용 가능한 일반화 가능한 비지도 프레임워크를 개발한다.
- 에너지 기반 모델을 사용하여 결합 에너지 예측을 생성 모델링 과제로 재정의하고, SE(3) 노이즈 제거 스코어 매칭을 통해 훈련한다.
- 원자 간의 힘과 토크를 모델링하기 위해 물리 원리를 활용한 새로운 등변 회전 예측 네트워크를 설계한다.
- 비용이 많이 드는 분자 동역학 시뮬레이션을 요구하지 않고 대규모 가상 스크리닝을 가능하게 한다.
제안 방법
- 결정 구조의 가능성을 극대화하기 위해 비라벨 단백질-리간드 복합체에서 에너지 기반 모델(EBM)을 SE(3) 노이즈 제거 스코어 매칭(DFM)을 사용해 훈련한다.
- 원자 힘을 사용하여 토크를 모델링하는 회전 예측 네트워크인 신경 오일러의 회전 방정식(NERE)을 도입한다.
- 원자 힘을 원자 좌표에 대한 에너지 함수의 도함수로 정의함으로써 물리학적으로 영감을 받은 등변 회전 추정을 가능하게 한다.
- 복합체의 전역적 회전과 이동에 대해 불변인 방식으로 회전 예측 네트워크를 구성함으로써 SE(3) 등변성을 확보한다.
- 예측된 회전 및 이동 노이즈를 사용하여 DSM 손실을 계산하고, EBM의 엔드 투 엔드 훈련을 가능하게 한다.
- SE(3) 불변 단백질 및 리간드 인코더를 NERE와 결합하여 복합체의 맥락 인식 기하학적 표현을 학습한다.
실험 결과
연구 질문
- RQ1SE(3) 노이즈 제거 스코어 매칭을 통해 훈련된 비지도 에너지 기반 모델은 라벨이 없는 데이터로도 결합 친화도를 예측할 수 있는가?
- RQ2물리학적으로 영감을 받은 등변 회전 예측 네트워크(NERE)는 표준 기준 모델보다 결합 에너지 추정 성능을 향상시키는가?
- RQ3항체의 경우와 같이 결합 친화도 데이터가 극히 부족할 때, 제안된 방법의 성능은 지도 학습 모델과 비교해 어떻게 되는가?
- RQ4등변 모델링과 물리적 사전 지식은 단백질-리간드 결합 예측에서 일반화 능력을 얼마나 향상시키는가?
- RQ5모델의 어텐션 패atters와 상호작용 에너지 히트맵은 CDR-H3 및 CDR-L3 잔기와 같이 알려진 생물학적 결합 결정 요소와 어떻게 일치하는가?
주요 결과
- NERE는 소분자 및 항체-항원 결합 친화도 벤치마크에서 모두 물리 기반 포텐셜(MM/GBSA)과 단백질 언어 모델(ESM-1v, ESM-IF)을 포함한 모든 비지도 기준 모델을 능가한다.
- 항체-항원 설정에서 NERE는 모든 지도 기준 모델을 뛰어넘으며, 라벨 데이터가 극히 부족한 상황에서 비지도 미리 훈련의 이점을 보여준다.
- 복합체의 결정 구조는 항상 예측된 에너지 장에서 局부 최소값 근처에 위치하며, 안정적이고 물리적으로 타당한 예측을 의미한다.
- 상호작용 에너지 히트맵의 시각화 결과 NERE는 CDR-H3 및 CDR-L3 잔기에 가장 높은 결합 에너지 기여도를 할당함으로써 알려진 항체 결합 결정 요소와 일치한다.
- 제거 실험 결과, 단백질 인코더의 SE(3) 불변성과 회전 및 이동 노이즈를 별도로 모델링하는 것이 성능에 매우 중요하다는 것이 확인되었다.
- ESM-2 언어 모델 특징을 제거한 경우에도 NERE-DSM는 합리적인 정확도를 유지하므로 기하학적 및 물리적 사전 지식이 성능의 주요 원동력임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.