Skip to main content
QUICK REVIEW

[논문 리뷰] Deep learning is competing random forest in computational docking

Mohamed A. Khamis, Walid Gomaa|arXiv (Cornell University)|2016. 08. 23.
Computational Drug Discovery Methods인용 수 5
한 줄 요약

이 연구는 PDBbind 2013 데이터베이스를 사용하여 딥 러닝(DL) 및 랜덤 포레스트(RF) 스코링 함수의 계산적 도킹 성능을 평가한다. 딥 러닝 기반 스코링 함수가 스코링, 랭킹, 도킹, 스크리닝 작업 전반에서 뛰어난 성능을 보이며, 특히 DL_RF 앙상블 모델이 결합 친화도 예측에서 피어슨 상관계수 0.799, 네이티브 포즈 식별 성공률 36.0%를 기록하여 모든 지표에서 기존의 RF 모델을 능가한다.

ABSTRACT

Computational docking is the core process of computer-aided drug design; it aims at predicting the best orientation and conformation of a small drug molecule when bound to a target large protein receptor. The docking quality is typically measured by a scoring function: a mathematical predictive model that produces a score representing the binding free energy and hence the stability of the resulting complex molecule. We analyze the performance of both learning techniques on the scoring power, the ranking power, docking power, and screening power using the PDBbind 2013 database. For the scoring and ranking powers, the proposed learning scoring functions depend on a wide range of features (energy terms, pharmacophore, intermolecular) that entirely characterize the protein-ligand complexes. For the docking and screening powers, the proposed learning scoring functions depend on the intermolecular features of the RF-Score to utilize a larger number of training complexes. For the scoring power, the DL\_RF scoring function achieves Pearson's correlation coefficient between the predicted and experimentally measured binding affinities of 0.799 versus 0.758 of the RF scoring function. For the ranking power, the DL scoring function ranks the ligands bound to fixed target protein with accuracy 54% for the high-level ranking and with accuracy 78% for the low-level ranking while the RF scoring function achieves (46% and 62%) respectively. For the docking power, the DL\_RF scoring function has a success rate when the three best-scored ligand binding poses are considered within 2 Å root-mean-square-deviation from the native pose of 36.0% versus 30.2% of the RF scoring function. For the screening power, the DL scoring function has an average enrichment factor and success rate at the top 1% level of (2.69 and 6.45%) respectively versus (1.61 and 4.84%) respectively of the RF scoring function.

연구 동기 및 목표

  • PDBbind 2013 벤치마크를 사용하여 딥 러닝(DL) 및 랜덤 포레스트(RF) 스코링 함수의 계산적 도킹 성능 평가
  • 스코링, 랭킹, 도킹, 스크리닝 파워의 네 가지 핵심 도킹 평가 기준에서 DL 및 RF 모델의 성능 비교
  • 딥 러닝이 결합 친화도 예측 및 네이티브 결합 포즈 식별에서 기존의 RF 기반 스코링 함수를 능가할 수 있는지 조사
  • 특히 에너지 항목, 파마코포어, 상호분자 기능을 조합한 기능 공학이 모델 성능에 미치는 영향 평가
  • 특히 과적합을 방지하는 능력 측면에서 DL 모델과 RF 모델의 일반화 능력 비교

제안 방법

  • 연구는 다양한 분자 기능을 활용한다: RF-Score에서 유래한 36개의 상호분자 기능, BALL 소프트웨어에서 유래한 5개의 에너지 항목, X-Score에서 유래한 8개의 항목, SLIDE 소프트웨어에서 유래한 59개의 파마코포어 기능을 스코링 및 랭킹 작업에 사용
  • 도킹 및 스크리닝 작업에서는 테스트 세트에 포함된 많은 수의 디코이와 대비해 훈련 복합체 수를 늘리기 위해 오직 RF-Score의 36개 상호분자 기능만 사용
  • 과적합 방지를 위해 L2 정규화와 드롭아웃을 적용한 다층 신경망을 사용하여 딥 러닝 모델을 훈련
  • 정규화 및 일반화 성능 향상을 위해 동일한 기능 세트를 기반으로 RF 모델도 훈련하여 DL 모델과의 공정한 비교 확보
  • DL 및 RF 스코어의 산술 평균을 사용하여 DL_RF 스코링 함수를 앙상블로 구성하여 두 모델의 강점을 융합
  • 평가 지표로는 스코링 능력에 대한 피어슨 상관계수, 고수준 및 저수준 랭킹 정확도, 도킹 성공에 대한 평균제곱근편차(RMSD), 가상 스크리닝에 대한 엿보강 인자 및 상위 1%에서의 성공률 사용

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 계산적 도킹에서 결합 친화도를 예측하는 데서 랜덤 포레스트 모델을 능가할 수 있는가?
  • RQ2동일한 단백질 타겟에 결합한 다수의 리간드를 랭킹할 때 DL 및 RF 스코링 함수는 어떻게 비교되는가?
  • RQ3DL 및 RF 모델이 컴퓨터로 생성된 디코이 중에서 네이티브 결합 포즈를 식별하는 데 성공률은 얼마인가?
  • RQ4특히 히트 리스트 상단에 진짜 결합체를 얼마나 잘 농축시키는지, DL 및 RF 모델의 가상 스크리닝 능력은 얼마나 효과적인가?
  • RQ5에너지 항목, 파마코포어, 상호분자 기능 등 다양한 분자 기능의 사용이 DL 및 RF 모델의 성능 향상에 실제로 기여하는가?

주요 결과

  • DL_RF 스코링 함수는 예측된 결합 친화도와 실험적으로 측정된 값 사이에 피어슨 상관계수 0.799를 기록하여 RF 스코링 함수(0.758)를 능가한다.
  • 고수준 랭킹(각 단백질에 대해 상위 3개 리간드를 정확히 랭킹)에서 DL 스코링 함수는 54%의 정확도를 기록하였고, RF 모델은 46%였다.
  • 저수준 랭킹(최상의 리간드를 정확히 식별)에서 DL 모델은 78%의 정확도를 기록하였고, RF 모델은 62%였다.
  • 도킹 능력에서 DL_RF 스코링 함수는 2 Å RMSD 이내에 네이티브 결합 포즈를 식별하는 데 36.0%의 성공률을 기록하였고, RF 모델은 30.2%였다.
  • 가상 스크리닝에서 DL 스코링 함수는 상위 1% 수준에서 평균 엿보강 인자 2.69와 성공률 6.45%를 기록하였고, RF 모델은 각각 1.61과 4.84%를 기록하여 모두를 초월했다.
  • DL 모델이 훈련 오차는 더 높지만 테스트 세트 성능이 뛰어나 일반화 능력이 뛰어나 보이며, 이는 L2 정규화와 드롭아웃으로 인해 과적합이 줄어들었기 때문일 가능성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.