Skip to main content
QUICK REVIEW

[논문 리뷰] Pre-Training on Large-Scale Generated Docking Conformations with HelixDock to Unlock the Potential of Protein-ligand Structure Prediction Models

Lihang Liu, Shanzhuo Zhang|arXiv (Cornell University)|2023. 10. 21.
Computational Drug Discovery Methods인용 수 6
한 줄 요약

이 논문은 물리기반 도킹 도구로 생성된 1억 개의 단백질-리간드 도킹 구조를 기반으로 사전 훈련한 기하학적 인식 SE(3)-동형 딥러닝 모델인 HelixDock을 제안한다. 이후 제한된 실험 데이터로 미세조정한 결과, 최신 기술 대비 RMSD에서 40% 이상 향상되어 단백질-리간드 구조 예측의 정확도와 강인성을 높였다. 이는 대규모 생성 데이터를 활용해 물리적 지식을 임bedding하는 데 기여한다.

ABSTRACT

Protein-ligand structure prediction is an essential task in drug discovery, predicting the binding interactions between small molecules (ligands) and target proteins (receptors). Recent advances have incorporated deep learning techniques to improve the accuracy of protein-ligand structure prediction. Nevertheless, the experimental validation of docking conformations remains costly, it raises concerns regarding the generalizability of these deep learning-based methods due to the limited training data. In this work, we show that by pre-training on a large-scale docking conformation generated by traditional physics-based docking tools and then fine-tuning with a limited set of experimentally validated receptor-ligand complexes, we can obtain a protein-ligand structure prediction model with outstanding performance. Specifically, this process involved the generation of 100 million docking conformations for protein-ligand pairings, an endeavor consuming roughly 1 million CPU core days. The proposed model, HelixDock, aims to acquire the physical knowledge encapsulated by the physics-based docking tools during the pre-training phase. HelixDock has been rigorously benchmarked against both physics-based and deep learning-based baselines, demonstrating its exceptional precision and robust transferability in predicting binding confirmation. In addition, our investigation reveals the scaling laws governing pre-trained protein-ligand structure prediction models, indicating a consistent enhancement in performance with increases in model parameters and the volume of pre-training data. Moreover, we applied HelixDock to several drug discovery-related tasks to validate its practical utility. HelixDock demonstrates outstanding capabilities on both cross-docking and structure-based virtual screening benchmarks.

연구 동기 및 목표

  • 딥러닝 기반 단백질-리간드 구조 예측 모델의 데이터 부족성과 일반화 능력 제한 문제를 해결하기 위해.
  • 기존 도구로 생성된 대규모이고 물리적으로 타당한 도킹 구조를 기반으로 사전 훈련하여 예측 정확도를 향상시키기 위해.
  • 사전 훈련된 단백질-리간드 구조 예측 모델의 스케일링 법칙을 조사하기 위해.
  • 특히 SARS-CoV-2와 관련된 단백질-리간드 복합체를 포함한 도전적인 신규 복합체에 대한 모델 강인성을 향상시키기 위해.
  • 물리기반 구조 생성과 딥러닝을 융합하는 것이 AI 기반 신약 개발에 실현 가능하고 우수한 성능을 낼 수 있음을 입증하기 위해.

제안 방법

  • 물리기반 도킹 도구를 사용해 생성한 1억 개의 단백질-리간드 도킹 구조를 기반으로 SE(3)-동형 신경망을 사전 훈련한다.
  • 힘장력과 평가 함수로부터 유래한 물리적 지식을 임베딩하기 위해 대규모이고 다양한 생성 구조 데이터셋을 활용한다.
  • 실제 결합 기하학적 구조에 적응하기 위해 사전 훈련된 모델을 실험적으로 검증된 수용체-리간드 복합체의 제한된 세트로 미세조정한다.
  • 모델 일반화 및 테스트 세트의 다양성을 평가하기 위해 구조 정렬 전략과 상호작용 지문 유사도를 활용한다.
  • 포켓 부피를 계산하고 PLEC 지문에 대해 Tanimoto 유사도를 적용하여 훈련 데이터와의 구조적 및 화학적 유사도를 평가한다.
  • PDBBind 및 PDB-COVID19 데이터셋에서 물리기반 및 딥러닝 기반 베이스라인과의 비교를 통해 RMSD, 친화도 예측 및 강인성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1대규모로 생성된 도킹 구조를 기반으로 한 사전 훈련이 딥러닝 기반 단백질-리간드 구조 예측 모델의 정확도를 크게 향상시킬 수 있는가?
  • RQ2모델 크기와 사전 훈련 데이터 양의 증가에 따라 모델 성능가 어떻게 변화하는가?
  • RQ3물리기반으로 생성된 데이터를 기반으로 한 사전 훈련이 새로운 단백질-리간드 복합체, 특히 실험 데이터가 제한된 복합체에 대한 일반화 능력을 향상시키는가?
  • RQ4SARS-CoV-2 관련 단백질과 같은 도전적인 타겟에서 최신 기술 대비 모델 성능은 어떠한가?
  • RQ5생성된 구조에 임bedded된 물리적 지식이 최종 예측 정확도와 강인성에 어떤 영향을 미치는가?

주요 결과

  • HelixDock는 표준 벤치마크 데이터셋에서 가장 가까운 경쟁자 대비 RMSD에서 40% 이상 향상되었으며, PDBBind 코어 세트에서 RMSD는 2.06 Å를 기록했다.
  • PDB-COVID19 데이터셋에서 뛰어난 성능을 보였으며, 11개의 주요 SARS-CoV-2 단백질 타겟 중 10개에서 베이스라인을 초월했다.
  • PDBBind 코어 세트에서 친화도 예측 RMSE는 1.159, 피어슨 상관계수는 0.844를 기록했으며, 모든 베이스라인을 능가했다.
  • 모델 크기와 사전 훈련 데이터 양 증가에 따라 일관된 성능 향상이 관찰되어 단백질-리간드 구조 예측에서 관측된 스케일링 법칙을 확인했다.
  • 생성된 데이터를 기반으로 한 사전 훈련이 일반화 능력을 크게 향상시켰음을 입증하였으며, 훈련 데이터와 유사하지 않은 다양한 도전적인 타겟에서도 성능 향상이 관찰되었다.
  • 제거 실험 결과, 사전 훈련 없이 사용한 HelixDock는 성능이 열악했으며(RMSE = 1.470), 이는 대규모 생성 구조에 기반한 사전 훈련의 핵심적 역할을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.