Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot 3D Drug Design by Sketching and Generating

Siyu Long, Yi Zhou|arXiv (Cornell University)|Sep 28, 2022
Computational Drug Discovery Methods被引用 9
一句话总结

本文提出 Desert,一种零样本 3D 药物设计方法,将药物生成分为两个阶段:形状草图绘制与分子生成,以分子形状作为桥梁。通过利用大规模分子数据库(ZINC)进行预训练,并最大限度减少对实验数据或对接模拟的依赖,Desert 在药物设计的速度与质量方面达到最先进水平,后处理后的 Vina 得分为 -9.410 kcal/mol,多样性得分高达 0.908。

ABSTRACT

Drug design is a crucial step in the drug discovery cycle. Recently, various deep learning-based methods design drugs by generating novel molecules from scratch, avoiding traversing large-scale drug libraries. However, they depend on scarce experimental data or time-consuming docking simulation, leading to overfitting issues with limited training data and slow generation speed. In this study, we propose the zero-shot drug design method DESERT (Drug dEsign by SkEtching and geneRaTing). Specifically, DESERT splits the design process into two stages: sketching and generating, and bridges them with the molecular shape. The two-stage fashion enables our method to utilize the large-scale molecular database to reduce the need for experimental data and docking simulation. Experiments show that DESERT achieves a new state-of-the-art at a fast speed.

研究动机与目标

  • 解决现有深度学习方法在从头药物设计中数据依赖性强、速度慢且易过拟合的局限性。
  • 减少在 3D 药物生成中对昂贵的实验生物活性数据和耗时的对接模拟的依赖。
  • 通过将分子形状作为蛋白质-配体互补性的结构先验,实现零样本药物设计。
  • 开发一种两阶段框架——草图绘制与生成——以提升在多种蛋白质靶标上的效率与泛化能力。
  • 在无需目标特异性微调或大规模标注数据的情况下,实现高质量、多样化且快速的药物候选物生成。

提出的方法

  • 将药物设计过程划分为两个阶段:首先绘制与靶标口袋互补的分子形状,随后从这些形状生成 3D 分子结构。
  • 使用在 ZINC 数据库中 1 亿对分子-形状数据上预训练的生成模型(Shape2Mol),将绘制的形状映射为 3D 分子结构。
  • 以分子形状作为结构先验,连接草图绘制与生成阶段,假设形状互补性可预测生物活性。
  • 仅在后处理阶段使用对接模拟,避免在生成过程中因对接模拟的性能瓶颈与不准确性而影响结果。
  • 在初始评估中采用贪婪解码策略且不进行后处理,而在最终性能评估中应用标准后处理(如能量最小化)。
  • 利用大规模、未绑定且具有药物样的分子数据库进行预训练,实现对新型蛋白质靶标的零样本泛化,无需微调。

实验结果

研究问题

  • RQ1在零样本 3D 药物设计中,分子形状如何作为生物活性的可靠代理?
  • RQ2减少对实验数据和对接模拟的依赖,对从头药物生成的速度与质量有何影响?
  • RQ3两阶段框架(草图绘制后接基于形状的生成)是否能实现在 3D 药物设计中的最先进性能?
  • RQ4在大规模多样化分子数据库上进行预训练,如何提升在未见蛋白质靶标上的泛化能力?
  • RQ5基于形状的草图绘制是否能有效缩小分子搜索空间,同时保持高亲和力与多样化的药物候选物?

主要发现

  • Desert 在测试集上经后处理后达到新的最先进 Vina 得分为 -9.410 kcal/mol,显著优于 3D SBDD 的 -7.584 kcal/mol。
  • Desert 生成的分子多样性得分高达 0.908(后处理后),表明其在化学空间中实现了广泛探索。
  • 即使不进行后处理,Desert 仍可实现 -6.148 kcal/mol 的 Vina 得分与 0.873 的多样性得分,展现出强大的内在设计能力。
  • 性能随采样空间大小的增加而提升,基于形状的剪枝可将有效搜索空间从 200K 降低至 10K 个分子,同时保持高性能。
  • Desert 在 100 个多样化的蛋白质靶标上表现出良好泛化能力,即使在实验数据有限或缺失的情况下,仍能生成多样且高亲和力的分子。
  • 该方法无需微调或目标特异性数据即可实现高性能,证实其具备零样本泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。