[논문 리뷰] Using Bayesian Optimization to Accelerate Virtual Screening for the Discovery of Therapeutics Appropriate for Repurposing for COVID-19
이 논문은 SARS-CoV-2에 대한 기존 약물의 재편용을 가속화하기 위해 베이지안 최적화를 사용하고, PDTS(병렬 다각도 톰슨 샘플링) 알고리즘을 적용한다. 대규모 화합물 라이브러리에서 높은 잠재력을 지닌 화합물을 지능적으로 우선순위를 정함으로써 시뮬레이션 횟수를 줄인다. 이 방법은 랜덤 샘플링 대비 상위 스코어를 가진 분자의 농축 효과가 뛰어나며, 전체 데이터셋의 일부에 불과한 자원으로도 상위 20%의 VINA 스코어를 92%의 성공률로 포착한다.
The novel Wuhan coronavirus known as SARS-CoV-2 has brought almost unprecedented effects for a non-wartime setting, hitting social, economic and health systems hard.~ Being able to bring to bear pharmaceutical interventions to counteract its effects will represent a major turning point in the fight to turn the tides in this ongoing battle.~ Recently, the World's most powerful supercomputer, SUMMIT, was used to identify existing small molecule pharmaceuticals which may have the desired activity against SARS-CoV-2 through a high throughput virtual screening approach. In this communication, we demonstrate how the use of Bayesian optimization can provide a valuable service for the prioritisation of these calculations, leading to the accelerated identification of high-performing candidates, and thus expanding the scope of the utility of HPC systems for time critical screening
연구 동기 및 목표
- 계산적으로 효율적인 스크리닝을 통해 SARS-CoV-2에 대한 재편용 가능한 치료제를 신속하게 식별할 수 있는 긴급한 필요성을 해결하기 위해.
- SUMMIT과 같은 대규모 HPC 자원에 대한 의존도를 줄이기 위해, 더 작은 클러스터에서도 동일한 스크리닝 효율을 달성할 수 있도록 하기 위해.
- 베이지안 최적화가 가상 스크리닝에서 높은 친화도를 지닌 약물 후보를 우선순위 정렬하는 데 랜덤 샘플링을 능가할 수 있는지 평가하기 위해.
- 시간이 급한 고계산 비용의 약물 개발 상황에서, 베이지안 최적화의 재현성과 강건성을 입증하기 위해.
제안 방법
- 이 연구는 8,000개의 분자로 구성된 가상 스크리닝 데이터셋에서 화합물을 우선순위 정하기 위해 병렬 다각도 톰슨 샘플링(PDTS) 배치 베이지안 최적화 알고리즘을 적용한다.
- 가우시안 프로세스 서rogate 모델을 사용하여 결합 친화도(VINA 스코어)를 예측하고 불확실성을 정량화함으로써, 유망한 후보를 정보 기반으로 선택할 수 있도록 한다.
- 기대 개선도(Expected Improvement) 획득 기능을 톰슨 샘플링을 통해 변형하여, 각 반복에서 다수의 화합물을 동시에 평가할 수 있도록 한다.
- 성능 지표로 VINA 도킹 스코어를 사용하여, S-단백질-ACE2 인터페이스와 고립된 S-단백질이라는 두 개의 타겟에서 방법을 평가한다.
- 결과의 재현성과 통계적 안정성을 평가하기 위해 PDTS의 독립적인 다섯 번의 실행을 수행한다.
- 최고 스코어, 상위 10개 평균, '빈(bin)'에 속하는 상위 스코어 화합물 비율 등의 지표를 사용하여 성능을 랜덤 샘플링과 비교한다.
실험 결과
연구 질문
- RQ1베이지안 최적화가 고결합 친화도를 지닌 약물 후보를 식별하는 데 있어, 필요한 가상 스크리닝 평가 횟수를 크게 줄일 수 있는가?
- RQ2PDTS 알고리즘이 SARS-CoV-2 치료제에 대한 가상 스크리닝에서 상위 성능을 보이는 화합물을 얼마나 효과적으로 농축하는가?
- RQ3작은 컴퓨팅 클러스터에 베이지안 최적화를 조합할 경우, SUMMIT과 같은 대규모 HPC 시스템의 성능을 어느 정도 재현할 수 있는가?
- RQ4시간이 급한 약물 재편용 응용 분야에서 PDTS 방법은 다섯 번의 독립 실행 간에 강건하고 재현 가능한가?
주요 결과
- S-단백질-ACE2 인터페이스 작업에서 PDTS 알고리즘이 -7.70의 최고 VINA 스코어를 기록하여, 랜덤 샘플링의 -6.74보다 뚜렷이 뛰어나다.
- 고립된 S-단백질 타겟에서 PDTS는 -7.18의 최고 스코어를 기록했고, 랜덤 샘플링의 -6.72보다 항상 뛰어나다는 것을 입증했다.
- PDTS는 상위 20%의 VINA 스코어를 포착하는 데 92%의 성공률를 기록했으며, 랜덤 샘플링은 이 비율이 42%에 불과했다.
- S-단백질-ACE2 작업에서 PDTS의 상위 10개 평균 스코어는 -7.04였고, 랜덤 샘플링의 평균 -7.30보다 뛰어났다.
- 다섯 번의 실행에서 표준편차가 낮았으며(예: S-단백질-ACE2에서 최고 스코어 기준 0.14), 높은 재현성과 신뢰성을 보였다.
- 고립된 S-단백질 타겟에서 PDTS 샘플러는 상위 스코어 화합물 비율이 1.79%였고, 전체 데이터셋의 56%에 비해 효율적인 농축 효과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.