[论文解读] Using Bayesian Optimization to Accelerate Virtual Screening for the Discovery of Therapeutics Appropriate for Repurposing for COVID-19
本文提出使用贝叶斯优化结合PDTS(并行多样化汤普森采样)算法,以加速现有药物针对SARS-CoV-2的虚拟筛选。通过智能优先筛选大规模分子库中的高潜力化合物,该方法显著减少了所需模拟次数——与随机采样相比,展现出更优的高分分子富集效果,仅使用完整数据集的一小部分,即实现了92%的成功率,捕获了VINA得分最高的20%分子。
The novel Wuhan coronavirus known as SARS-CoV-2 has brought almost unprecedented effects for a non-wartime setting, hitting social, economic and health systems hard.~ Being able to bring to bear pharmaceutical interventions to counteract its effects will represent a major turning point in the fight to turn the tides in this ongoing battle.~ Recently, the World's most powerful supercomputer, SUMMIT, was used to identify existing small molecule pharmaceuticals which may have the desired activity against SARS-CoV-2 through a high throughput virtual screening approach. In this communication, we demonstrate how the use of Bayesian optimization can provide a valuable service for the prioritisation of these calculations, leading to the accelerated identification of high-performing candidates, and thus expanding the scope of the utility of HPC systems for time critical screening
研究动机与目标
- 为应对利用计算高效筛选手段快速识别可重定位治疗药物的迫切需求,针对SARS-CoV-2开展研究。
- 通过使小型计算集群也能实现与SUMMIT等大规模高性能计算系统相当的筛选效率,减少对海量HPC资源的依赖。
- 评估贝叶斯优化是否能在虚拟筛选中优于随机采样,更有效地优先筛选出高亲和力药物候选物。
- 展示贝叶斯优化在时间紧迫、计算成本高昂的药物发现场景下的可重复性与鲁棒性。
提出的方法
- 本研究将PDTS(并行多样化汤普森采样)批量贝叶斯优化算法应用于包含8,000个分子的虚拟筛选数据集,以优先筛选化合物。
- 采用高斯过程代理模型预测结合亲和力(VINA得分)并量化不确定性,从而实现对有前景候选物的智能选择。
- 通过汤普森采样对期望改进获取函数进行调整,实现每次迭代中并行评估多个化合物。
- 在两个靶点上评估该方法:S蛋白-ACE2界面和孤立的S蛋白,以VINA对接得分为性能指标。
- 进行五次独立的PDTS运行,以评估结果的可重复性与统计稳定性。
- 通过最佳得分、前10名平均分以及‘得分区间’中高分化合物占比等指标,与随机采样及理想情况对比性能表现。
实验结果
研究问题
- RQ1贝叶斯优化能否在显著减少所需虚拟筛选评估次数的同时,维持甚至提升对高亲和力药物候选物的识别能力?
- RQ2在针对SARS-CoV-2治疗药物的虚拟筛选中,PDTS算法相较于随机采样在富集高性能化合物方面表现如何?
- RQ3当与贝叶斯优化结合时,小型计算集群在多大程度上可实现与SUMMIT等大规模HPC系统相当的性能?
- RQ4PDTS方法在时间紧迫的药物重定位应用中,是否具备跨多次独立运行的鲁棒性与可重复性?
主要发现
- 在S蛋白-ACE2界面任务中,PDTS算法取得了-7.70的最优VINA得分,显著优于随机采样的-6.74。
- 在孤立S蛋白靶点中,PDTS取得-7.18的最优得分,而随机采样为-6.72,表现出一致的优越性。
- PDTS在捕获VINA得分最高20%的化合物(即‘高分区间’)方面达到92%的成功率,而随机采样仅为42%。
- 在S蛋白-ACE2任务中,PDTS的前10名平均得分为-7.04,优于随机采样的-7.30。
- 五次运行中标准差极低(如S蛋白-ACE2任务中最佳得分的标准差为0.14),表明结果具有高度可重复性与可靠性。
- 在孤立S蛋白任务中,PDTS采样器实现了1.79%的高分化合物占比,而完整数据集为56%,表明在计算资源受限条件下仍能实现有效富集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。