[论文解读] DeepScaffold: a comprehensive tool for scaffold-based de novo drug discovery using deep learning
DeepScaffold 是一种用于基于骨架的从头药物设计的深度学习框架,可生成匹配多种骨架定义(包括 Bemis-Murcko 骨架、环状骨架和侧链特异性骨架)的分子,同时保证骨架保真度。其生成分子的有效性高达 97.4–98.9%,独特性达 45.4–87.7%,并具有良好的生物活性,能重现 15.9% 的活性分子和 25% 的已知药物,其对接评分与活性化合物相当。
The ultimate goal of drug design is to find novel compounds with desirable pharmacological properties. Designing molecules retaining particular scaffolds as the core structures of the molecules is one of the efficient ways to obtain potential drug candidates with desirable properties. We proposed a scaffold-based molecular generative model for scaffold-based drug discovery, which performs molecule generation based on a wide spectrum of scaffold definitions, including BM-scaffolds, cyclic skeletons, as well as scaffolds with specifications on side-chain properties. The model can generalize the learned chemical rules of adding atoms and bonds to a given scaffold. Furthermore, the generated compounds were evaluated by molecular docking in DRD2 targets and the results demonstrated that this approach can be effectively applied to solve several drug design problems, including the generation of compounds containing a given scaffold and de novo drug design of potential drug candidates with specific docking scores. Finally, a command line interface is created.
研究动机与目标
- 为解决现有生成模型在基于骨架的药物发现中难以保持骨架身份或泛化至新骨架的局限性。
- 开发一个统一框架,能够基于多种骨架定义(包括环状骨架和药效团感知骨架)生成分子。
- 确保生成的分子严格匹配输入骨架查询,同时保持化学有效性和类药物性质。
- 评估模型重现已知活性化合物以及生成具有有利对接评分的生物活性分子的能力。
提出的方法
- DeepScaffold 采用三部分架构:用于骨架补全的图神经网络、基于骨架的分子生成模型,以及基于药效团查询的侧链过滤器。
- 该模型使用基于图自编码的条件变分自编码器(VAE),根据输入骨架生成分子,确保骨架保留。
- 其引入了一种可微分的分子生成过程,基于学习到的类似反应的规则,以化学上合理的方式逐步添加原子和化学键。
- 该框架支持多种骨架类型:Bemis-Murcko 骨架、环状骨架(CSKs),以及具有侧链性质约束的骨架(如氢键供体、logP)。
- 通过后处理过滤步骤,利用基于药效团的规则强制执行侧链性质规范,提升与药物设计的相关性。
- 模型在大规模类药物分子数据集上进行训练,并通过有效性、唯一性、多样性(MMD)以及与 DRD2 的对接评分等指标进行评估。
实验结果
研究问题
- RQ1深度生成模型能否可靠地生成严格保留给定骨架的分子,无论骨架定义如何?
- RQ2该模型在不同骨架类型(包括环状骨架和侧链修饰骨架)下,能否生成化学有效且多样的分子?
- RQ3该模型在 GPCR 靶标中,能在多大程度上重现已知活性药物和生物活性化合物的特权骨架?
- RQ4生成分子的对接亲和力与已知活性化合物及随机 ChEMBL 分子相比如何?
- RQ5该模型能否在无需微调的情况下泛化至训练分布之外的新骨架?
主要发现
- 对于骨架 14,模型成功重现了 15.9% 的已知活性分子和 25% 的已知药物,表明其在利用特权骨架进行药物发现方面具有强大能力。
- 模型实现了高有效性(98.6–98.9%)和高独特性(45.4–87.7%),MMD 值为 0.00875–0.154,表明其分布与真实分子具有良好的相似性。
- 骨架 13 和 14 生成的分子在 DRD2 上的预测对接评分显著高于随机 ChEMBL 化合物,表明其生物活性更强。
- 模型生成了多样的取代模式,尤其在骨架 14 上,其侧链多样性高于 ChEMBL,表明其泛化能力超越了训练数据。
- 模型倾向于在氮原子上添加较大的侧链,可能是由于合成可及性与类药物性质之间的平衡。
- 对于骨架 12,模型表现与随机 ChEMBL 化合物差异不明显,可能是因为其生物活性特权较低且在多种靶标中广泛存在。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。