Skip to main content
QUICK REVIEW

[论文解读] Pandemic Drugs at Pandemic Speed: Infrastructure for Accelerating COVID-19 Drug Discovery with Hybrid Machine Learning- and Physics-based Simulations on High Performance Computers

Agastya P. Bhati, Shunzhou Wan|arXiv (Cornell University)|Mar 4, 2021
Computational Drug Discovery Methods参考文献 95被引用 42
一句话总结

本文提出了一种由高性能计算(HPC)加速的混合机器学习(ML)与物理基础(PB)模拟工作流,以前所未有的速度识别SARS-CoV-2的抗病毒药物候选物。通过整合热力学积分与增强采样(TIES)以实现精确的结合亲和力预测,并结合机器学习模型以高效探索化学空间,该框架实现了对数百万种化合物的高通量筛选,成功识别出针对四种病毒靶标的先导化合物,并提供了定量的自由能预测。

ABSTRACT

The race to meet the challenges of the global pandemic has served as a reminder that the existing drug discovery process is expensive, inefficient and slow. There is a major bottleneck screening the vast number of potential small molecules to shortlist lead compounds for antiviral drug development. New opportunities to accelerate drug discovery lie at the interface between machine learning methods, in this case developed for linear accelerators, and physics-based methods. The two in silico methods, each have their own advantages and limitations which, interestingly, complement each other. Here, we present an innovative infrastructural development that combines both approaches to accelerate drug discovery. The scale of the potential resulting workflow is such that it is dependent on supercomputing to achieve extremely high throughput. We have demonstrated the viability of this workflow for the study of inhibitors for four COVID-19 target proteins and our ability to perform the required large-scale calculations to identify lead antiviral compounds through repurposing on a variety of supercomputers.

研究动机与目标

  • 通过加速识别SARS-CoV-2的抗病毒化合物,解决传统药物发现中耗时约10年、耗资10亿至30亿美元的瓶颈问题。
  • 通过整合机器学习与物理基础方法的互补优势——ML实现速度、PB实现精度——克服单一方法的局限性。
  • 开发一种可扩展的、高通量的计算基础设施,能够跨多种超级计算机处理大规模模拟。
  • 通过高精度预测配体与关键SARS-CoV-2靶蛋白的结合亲和力,实现现有药物的快速再利用。
  • 在ML与PB模拟之间建立迭代反馈回路,以优化预测并指导化学结构改造,从而获得最优先导化合物。

提出的方法

  • 采用热力学积分与增强采样(TIES)进行蛋白质-配体结合亲和力的精确、可重复且可扩展的自由能计算。
  • 使用集合模拟以减少混沌初始条件带来的变异性,提高结合亲和力预测的统计可靠性。
  • 将TIES预测的结合亲和力作为训练数据,迭代优化机器学习模型,以预测配体效力。
  • 实施多阶段过滤工作流:先进行ML初步筛选,再对优选候选物进行高精度TIES验证。
  • 利用高性能计算(HPC)基础设施,跨SuperMUC-NG、OLCF和TACC等多台超级计算机扩展模拟规模。
  • 使用专用工作流管理器(如RCT)协调跨异构、计算密集型HPC资源的分布式任务。

实验结果

研究问题

  • RQ1混合ML-PB模拟工作流是否能显著加速SARS-CoV-2药物再利用的先导化合物识别?
  • RQ2基于TIES的自由能计算在预测针对SARS-CoV-2蛋白的多样化配体结合亲和力方面准确度如何?
  • RQ3将PB模拟数据整合进ML模型在多大程度上提升了化学空间探索中的预测准确度与收敛速度?
  • RQ4该混合工作流是否能高效地跨多种异构HPC系统扩展,以实现疫情速度的药物发现?
  • RQ5配体的哪些结构变化会导致结合亲和力的有利或不利改变?这些变化是否可被可靠预测?

主要发现

  • 该混合ML-PB工作流成功利用多台超级计算机的大规模模拟,识别出针对四种SARS-CoV-2靶蛋白的先导抗病毒化合物。
  • TIES模拟在结合亲和力预测中表现出高精度与高可靠性,某些转化的不确定性低至±0.44 kcal/mol。
  • 对于ADRP靶标,19种配体转化中有12种导致ΔΔ𝐺 > +1 kcal/mol,表明结合亲和力显著下降;其余7种ΔΔ𝐺 ≈ 0,表明无显著影响。
  • 转化a42-a43导致最不利的变化,ΔΔ𝐺 = 4.62 ± 0.82 kcal/mol,表明结合显著不稳定化。
  • 工作流通过利用PB衍生的热力学数据,实现了ML模型的快速、迭代式优化,加速了向有希望的化学空间区域的收敛。
  • 整个工作流管道已成功部署于SuperMUC-NG、OLCF和TACC等多样化的HPC系统,证明了其可移植性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。