Skip to main content
QUICK REVIEW

[논문 리뷰] Self-focusing virtual screening with active design space pruning

David Graff, Matteo Aldeghi|arXiv (Cornell University)|2022. 05. 03.
Machine Learning in Materials Science인용 수 6
한 줄 요약

이 논문은 자기집중형 가상 스크리닝과 활성 설계 공간 절단(DSP)을 도입하여 베이지안 최적화의 계산 오버헤드를 줄이는 방법을 제안한다. 이 방법은 고려 대상에서 잠재력이 낮은 화합물을 영구적으로 제거함으로써 계산 비용을 절감한다. 히트 확률 임계값(p* = 0.025)을 설정함으로써 DSP는 성능이 기준 최적화와 유사한 수준을 유지하면서도 추론 비용을 40% 낮춘다. 벤치마크 테스트에서 상위 10,000개 화합물의 67.7%를 회수하였다.

ABSTRACT

High-throughput virtual screening is an indispensable technique utilized in the discovery of small molecules. In cases where the library of molecules is exceedingly large, the cost of an exhaustive virtual screen may be prohibitive. Model-guided optimization has been employed to lower these costs through dramatic increases in sample efficiency compared to random selection. However, these techniques introduce new costs to the workflow through the surrogate model training and inference steps. In this study, we propose an extension to the framework of model-guided optimization that mitigates inferences costs using a technique we refer to as design space pruning (DSP), which irreversibly removes poor-performing candidates from consideration. We study the application of DSP to a variety of optimization tasks and observe significant reductions in overhead costs while exhibiting similar performance to the baseline optimization. DSP represents an attractive extension of model-guided optimization that can limit overhead costs in optimization settings where these costs are non-negligible relative to objective costs, such as docking.

연구 동기 및 목표

  • 고속 가상 스크리닝을 위한 베이지안 최적화에서 서rogate 모델 추론의 계산 오버헤드를 줄이는 것.
  • 도킹 및 모델 추론 비용이 무시할 수 없는 대규모 화학 화합물 라이브러리에서의 확장성 문제를 해결하는 것.
  • 저잠재력 화합물을 설계 공간에서 영구적으로 제거함으로써 최적화 성능를 유지하는 방법을 개발하는 것.
  • 전체 도킹을 수행하지 않고도 초대규모 라이브러리(예: 21B 화합물)를 효율적으로 스크리닝할 수 있도록 하는 것.
  • 진짜 활성 물질을 제거할 위험과 계산 효율성 향상 사이의 균형을 맞추는 것.

제안 방법

  • 모델가 추출된 데이터를 기반으로 매 반복마다 훈련되는 서rogate 모델(Gaussian process 또는 Chemprop)을 사용한 배치 베이지안 최적화를 적용한다.
  • 모델 추론과 추출 유틸리티 계산 사이에 설계 공간 절단(DSP)을 적용하여 예측 히트 확률이 임계값(p* = 0.025) 이하인 화합물을 제거한다.
  • 히트 확률은 예측 목표값과 불확실성 값을 사용하여 계산되며, 화합물이 상위 성능 집합에 속할 가능성을 추정한다.
  • 절단은 영구적이며, 이후 반복에서 모델 추론이 필요한 화합물 수를 줄인다.
  • 절단의 공격성과 진짜 활성 물질을 잃을 위험 사이의 균형을 조절하기 위해 단일 추가 하이퍼파rameter(p*)를 사용한다.
  • 실제 배포 환경을 시뮬레이션하기 위해 각 반복에서 하이퍼파rameter 조정 없이 서rogate 모델을 다시 처음부터 훈련시킨다.

실험 결과

연구 질문

  • RQ1설계 공간 절단이 가상 스크리닝을 위한 베이지안 최적화에서 서rogate 모델 추론의 계산 비용을 상당히 줄일 수 있는가?
  • RQ2절단이 대규모 화학 화합물 라이브러리에서 상위 성능 화합물의 회수 성능에 어느 정도 영향을 미치는가?
  • RQ3히트 확률 임계값(p*)의 선택이 비용 절감과 진짜 활성 물질 제거 위험 사이의 균형에 어떻게 영향을 미치는가?
  • RQ4DSP는 초대규모 라이브러리 스크리닝에서 추론 오버헤드를 줄이면서도 기준 최적화와 유사한 성능을 유지할 수 있는가?
  • RQ5이 방법은 DOCKSTRING 및 AmpC-Glide와 같은 실제 도킹 데이터셋에 효과적으로 확장 가능한가?

주요 결과

  • 제안된 DSP 방법은 기준 베이지안 최적화 대비 추론 및 훈련 오버헤드 비용을 40% 감소시켰다.
  • 이 방법은 테스트 오라클 벤치마크에서 상위 10,000개 화합물의 67.7%를 성공적으로 회수하여 기준 최적화의 성능를 그대로 유지하였다.
  • p* = 0.025로 절단함으로써 낮은 잠재력 화합물을 효과적으로 제거하였고, 높은 성능의 분자의 회수 정확도에 영향을 주지 않았다.
  • 이 방법은 다양한 테스트 오라클 및 실제 도킹 데이터셋(DOCKSTRING 및 AmpC-Glide)에서 일관된 성능을 유지하였다.
  • 이 방법은 초대규모 라이브러리, 예를 들어 21B 화합물이 포함된 Enamine REAL 데이터베이스에 대해서도 확장 가능함을 입증하였다. 여기서 전수 스크리닝은 7,000년 이상의 CPU 연산이 필요할 것이다.
  • 단일 추가 하이퍼파rameter(p*)를 통해 사용자가 절단의 공격성과 거짓 음성 결과 발생 위험 사이의 균형을 조정할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.