Skip to main content
QUICK REVIEW

[论文解读] The Synthesizability of Molecules Proposed by Generative Models

Wenhao Gao, Connor W. Coley|arXiv (Cornell University)|Feb 17, 2020
Computational Drug Discovery Methods参考文献 35被引用 8
一句话总结

本文使用基于数据的逆合成规划工具(ASKCOS)评估了最先进深度生成模型生成的分子的可合成性,发现许多高分分子在实际合成中不可行。研究表明,通过使用SCScore或SA_Score等启发式方法进行偏差调整,可提升可合成性,但会以牺牲客观函数性能为代价,凸显了需要开发能更好平衡新颖性、性质优化与合成可行性的新算法。

ABSTRACT

The discovery of functional molecules is an expensive and time-consuming process, exemplified by the rising costs of small molecule therapeutic discovery. One class of techniques of growing interest for early-stage drug discovery is de novo molecular generation and optimization, catalyzed by the development of new deep learning approaches. These techniques can suggest novel molecular structures intended to maximize a multi-objective function, e.g., suitability as a therapeutic against a particular target, without relying on brute-force exploration of a chemical space. However, the utility of these approaches is stymied by ignorance of synthesizability. To highlight the severity of this issue, we use a data-driven computer-aided synthesis planning program to quantify how often molecules proposed by state-of-the-art generative models cannot be readily synthesized. Our analysis demonstrates that there are several tasks for which these models generate unrealistic molecular structures despite performing well on popular quantitative benchmarks. Synthetic complexity heuristics can successfully bias generation toward synthetically-tractable chemical space, although doing so necessarily detracts from the primary objective. This analysis suggests that to improve the utility of these models in real discovery workflows, new algorithm development is warranted.

研究动机与目标

  • 评估最先进深度生成模型在分子设计中生成的分子的合成可行性。
  • 量化在标准基准测试中得分较高的分子在实际自动化逆合成规划中不可合成的频率。
  • 评估不同偏差策略(事后过滤、训练集选择、启发式目标函数修改)在提升可合成性方面的有效性。
  • 识别在生成模型中优化分子性质与确保合成可及性之间的权衡。
  • 倡导开发能更优地将合成可行性整合到分子生成流程中的新算法。

提出的方法

  • 作者使用ASKCOS——一种基于数据的计算机辅助合成规划工具——来评估生成模型所生成分子的合成可及性。
  • 该方法应用于使用基于图的遗传算法在简单和复杂多目标优化(MPO)任务下生成的分子。
  • 事后过滤通过测试分子是否通过ASKCOS的可合成性过滤器来实现。
  • 通过使用ChEMBL(68.3%可合成)和MOSES(89.8%可合成)作为训练数据源,测试了训练集偏差。
  • 启发式偏差通过在目标函数中引入基于SCScore、SA_Score或SMILES长度的乘数来实现,采用高斯函数和S型函数对复杂或稀有片段进行惩罚。
  • 通过30轮树置信域估计(TPE)贝叶斯优化,对偏差函数的超参数进行调优,以最大化前10个分子的可合成率与平均目标得分的乘积。

实验结果

研究问题

  • RQ1尽管在标准基准测试中得分较高,最先进生成模型提出的分子在多大程度上在实际中不可合成?
  • RQ2事后过滤、训练集选择或启发式偏差在多大程度上能改善生成分子的可合成性?
  • RQ3在分子生成中,最大化目标函数(如类药物性)与实现合成可行性之间的权衡如何?
  • RQ4在SA_Score、SCScore和SMILES长度这三种启发式评分中,哪一种最有效地提升可合成性,同时不过度降低主要优化目标?
  • RQ5能否通过将合成可行性整合到生成目标中,实现更实用的分子设计,从而在真实药物发现工作流程中发挥更大作用?

主要发现

  • 最先进生成模型生成的大量分子在实际中不可合成,即使其在标准基准测试中得分较高,ASKCOS逆合成规划揭示了这一问题。
  • 使用ASKCOS进行事后过滤虽能减少可合成分子数量,但无法从根本上解决生成不可行结构的问题。
  • 训练集偏差显著提升了可合成性,其中MOSES(89.8%可合成)作为训练数据源优于ChEMBL(68.3%可合成)。
  • 使用SCScore或SA_Score进行启发式偏差显著提高了可合成分子的比例,但代价是前10个分子的平均目标函数得分下降。
  • 通过TPE贝叶斯优化确定了SCScore和SA_Score乘数的最优超参数,表明在目标性能与可合成性之间实现平衡是可行的。
  • SMILES长度被证明对可合成性偏差无效,因为无法为此指标获得有意义的超参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。