Skip to main content
QUICK REVIEW

[论文解读] Self-focusing virtual screening with active design space pruning

David Graff, Matteo Aldeghi|arXiv (Cornell University)|May 3, 2022
Machine Learning in Materials Science被引用 6
一句话总结

本文提出了一种自聚焦虚拟筛选方法,结合主动设计空间剪枝(DSP),通过不可逆地从考虑中移除低潜力化合物,减少了贝叶斯优化在虚拟筛选中的计算开销。通过设定命中概率阈值(p* = 0.025),DSP在保持与基线优化相当性能的同时,将推理成本降低了40%,在基准测试中检索到了67.7%的前10,000个化合物。

ABSTRACT

High-throughput virtual screening is an indispensable technique utilized in the discovery of small molecules. In cases where the library of molecules is exceedingly large, the cost of an exhaustive virtual screen may be prohibitive. Model-guided optimization has been employed to lower these costs through dramatic increases in sample efficiency compared to random selection. However, these techniques introduce new costs to the workflow through the surrogate model training and inference steps. In this study, we propose an extension to the framework of model-guided optimization that mitigates inferences costs using a technique we refer to as design space pruning (DSP), which irreversibly removes poor-performing candidates from consideration. We study the application of DSP to a variety of optimization tasks and observe significant reductions in overhead costs while exhibiting similar performance to the baseline optimization. DSP represents an attractive extension of model-guided optimization that can limit overhead costs in optimization settings where these costs are non-negligible relative to objective costs, such as docking.

研究动机与目标

  • 降低高通量虚拟筛选中代理模型推理的计算开销。
  • 解决大规模化学库中对接和模型推理成本不可忽略的可扩展性挑战。
  • 开发一种方法,在不可逆地从设计空间中剪枝低潜力化合物的同时保持优化性能。
  • 实现在不进行完整对接的情况下对超大化学库(例如210亿个化合物)的高效筛选。
  • 在移除真实活性分子的风险与计算效率提升之间取得平衡。

提出的方法

  • 该方法在每次迭代中使用代理模型(高斯过程或Chemprop)对获取的数据进行训练,采用批量贝叶斯优化。
  • 在模型推理与采集效用计算之间应用设计空间剪枝(DSP),移除预测命中概率低于阈值(p* = 0.025)的化合物。
  • 命中概率通过预测目标值和不确定性计算得出,用于估计某化合物属于高性能集合的可能性。
  • 剪枝操作不可逆,从而减少了后续迭代中需要进行模型推理的化合物数量。
  • 该方法仅引入一个额外的超参数(p*),用于控制剪枝的激进程度与丢失真实活性分子的风险之间的权衡。
  • 代理模型在每次迭代中从头开始重新训练,不进行超参数调优,以模拟真实世界中的部署场景。

实验结果

研究问题

  • RQ1设计空间剪枝是否能显著降低贝叶斯优化在虚拟筛选中代理模型推理的计算成本?
  • RQ2剪枝在多大程度上影响了在大规模化学库中检索高性能化合物的性能?
  • RQ3命中概率阈值(p*)的选择如何影响成本降低与丢失真实活性分子风险之间的平衡?
  • RQ4DSP是否能在降低推理开销的同时,保持与基线优化相当的性能,适用于超大库筛选?
  • RQ5该方法在真实对接数据集(如DOCKSTRING和AmpC-Glide)中是否具备有效的可扩展性?

主要发现

  • 所提出的DSP方法相比基线贝叶斯优化,将推理和训练开销降低了40%。
  • 该方法在测试基准数据集(oracle benchmark)中成功检索到了67.7%的前10,000个化合物,性能与基线优化相当。
  • 使用p* = 0.025进行剪枝有效去除了低潜力化合物,且未损害高性能分子的检索准确性。
  • 该方法在多种测试基准和真实对接数据集(DOCKSTRING和AmpC-Glide)中均保持了稳定的性能表现。
  • 该方法在超大库中表现出可扩展性,例如在包含210亿个化合物的Enamine REAL数据库中,完整筛选需要超过7,000个CPU年。
  • 仅引入的单一额外超参数(p*)使用户能够调节剪枝激进程度与假阴性风险之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。