[논문 리뷰] Pandemic Drugs at Pandemic Speed: Infrastructure for Accelerating COVID-19 Drug Discovery with Hybrid Machine Learning- and Physics-based Simulations on High Performance Computers
이 논문은 고성능 계산(HPC)으로 가속화된 하이브리드 기계학습(ML) 및 물리기반(PB) 시뮬레이션 워크플로우를 제시하여, 사스-코비-2(SARS-CoV-2)의 항바이러스 약물 후보를 이전에 보지 못한 속도로 식별한다. 열역학적 통합과 강화된 샘플링(TIES)을 통합하여 정확한 결합 친화도 예측을 하고, ML 모델을 활용해 효율적인 화학적 공간 탐색을 수행함으로써, 수백만 개의 화합물을 고속 스크리닝할 수 있는 프레임워크를 제공하며, 정량적 자유 에너지 예측을 통해 네 가지 바이러스 타겟에 대해 리드 화합물을 성공적으로 규명하였다.
The race to meet the challenges of the global pandemic has served as a reminder that the existing drug discovery process is expensive, inefficient and slow. There is a major bottleneck screening the vast number of potential small molecules to shortlist lead compounds for antiviral drug development. New opportunities to accelerate drug discovery lie at the interface between machine learning methods, in this case developed for linear accelerators, and physics-based methods. The two in silico methods, each have their own advantages and limitations which, interestingly, complement each other. Here, we present an innovative infrastructural development that combines both approaches to accelerate drug discovery. The scale of the potential resulting workflow is such that it is dependent on supercomputing to achieve extremely high throughput. We have demonstrated the viability of this workflow for the study of inhibitors for four COVID-19 target proteins and our ability to perform the required large-scale calculations to identify lead antiviral compounds through repurposing on a variety of supercomputers.
연구 동기 및 목표
- 기존 약물 개발 방식이 약 10년과 10억–30억 달러의 비용을 소요하는 데에 걸리는 블로커지를 해결하기 위해 사스-코비-2의 항바이러스 화합물 식별을 가속화한다.
- 단독 기계학습 또는 물리기반 방법의 한계를 극복하기 위해 상호보완적인 강점을 결합함으로써, ML의 빠른 처리 속도와 PB의 정확도를 동시에 확보한다.
- 다양한 슈퍼컴퓨터에서 대규모 시뮬레이션을 처리할 수 있는 확장성 있고 고속 스크리닝이 가능한 계산 인프라를 개발한다.
- 기존 약물의 재용도를 신속하게 가능하게 하기 위해, 리간드가 사스-코비-2의 핵심 타겟 단백질과 상호작용할 때의 결합 친화도를 고정밀도로 예측한다.
- ML과 PB 시뮬레이션 간의 반복 피드백 루프를 구축하여 예측을 정교화하고 최적의 리드 화합물로 향하는 화학적 수정을 안내한다.
제안 방법
- 단백질-리간드 결합 친화도의 정확하고 재현 가능하며 확장 가능한 자유 에너지 계산을 위해 열역학적 통합과 강화된 샘플링(TIES)을 적용한다.
- 혼합 시뮬레이션을 통해 혼돈된 초기 조건으로 인한 변동성을 줄이고, 결합 친화도 예측의 통계적 신뢰도를 향상시킨다.
- TIES를 통해 예측한 결합 친화도 데이터를 학습 데이터로 활용하여, 리간드의 효능을 예측하는 기계학습 모델을 반복적으로 개선한다.
- 다단계 필터링 워크플로우를 구현: 초기 ML 스크리닝 이후 상위 후보자들에 대해 고정밀 TIES 검증을 실시한다.
- SuperMUC-NG, OLCF, TACC 등 다양한 슈퍼컴퓨터를 활용해 HPC 인프라 구축을 통해 시뮬레이션 스케일링을 달성한다.
- 다양한 HPC 자원에 걸쳐 분산된 계산 집약적 작업을 조율하기 위해 전용 워크플로우 관리자(RCT 등)를 구현한다.
실험 결과
연구 질문
- RQ1하이브리드 ML-PB 시뮬레이션 워크플로우가 사스-코비-2의 약물 재용도를 위한 리드 화합물 식별을 상당히 가속화할 수 있는가?
- RQ2TIES 기반의 자유 에너지 계산은 사스-코비-2 단백질을 표적으로 삼는 다양한 리간드의 결합 친화도를 얼마나 정확하게 예측할 수 있는가?
- RQ3PB 시뮬레이션 데이터를 ML 모델에 통합할 경우, 화학적 공간 탐색에서 예측 정확도와 수렴 속도가 얼마나 향상되는가?
- RQ4이 하이브리드 워크플로우는 다양한 이질적인 HPC 시스템 간에 효율적으로 확장되어 패닉 속도의 약물 개발을 달성할 수 있는가?
- RQ5리간드의 구조적 변형이 결합 친화도에 유리하거나 불리한 영향을 미치는 경우는 무엇이며, 이러한 변화는 신뢰성 있게 예측할 수 있는가?
주요 결과
- 하이브리드 ML-PB 워크플로우는 다양한 슈퍼컴퓨터에서 대규모 시뮬레이션을 수행하여 사스-코비-2 타겟 단백질 네 개에 대해 리드 항바이러스 화합물을 성공적으로 규명하였다.
- TIES 시뮬레이션은 결합 친화도 예측에서 높은 정확도와 정밀도를 달성하였으며, 특정 변형에 대해 불확도가 ±0.44 kcal/mol까지 낮아졌다.
- ADRP 타겟의 경우, 19개의 리간드 변형 중 12개에서 ΔΔ𝐺 > +1 kcal/mol이 관찰되어 결합 친화도가 불리한 변화를 보였고, 나머지 7개는 ΔΔ𝐺 ≈ 0으로 유의미한 영향이 없음을 시사했다.
- a42-a43 변형은 가장 큰 불리한 변화를 보였으며, ΔΔ𝐺 = 4.62 ± 0.82 kcal/mol로 결합 친화도가 심각하게 약화됨을 나타냈다.
- 워크플로우를 통해 PB에서 유도된 에너지 데이터를 반복적으로 활용하여 ML 모델의 정교화를 신속하게 수행하였고, 유망한 화학적 공간 영역으로의 수렴 속도가 빨라졌다.
- 전체 파이프라인은 SuperMUC-NG, OLCF, TACC 등 다양한 HPC 시스템에 성공적으로 구현되어 이식성과 확장성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.