[论文解读] Zero-Shot 3D Drug Design by Sketching and Generating
本文提出 Desert,一种零样本 3D 药物设计方法,将药物生成分为两个阶段:形状草图绘制与分子生成,以分子形状作为桥梁。通过利用大规模分子数据库(ZINC)进行预训练,并最大限度减少对实验数据或对接模拟的依赖,Desert 在药物设计的速度与质量方面达到最先进水平,后处理后的 Vina 得分为 -9.410 kcal/mol,多样性得分高达 0.908。
Drug design is a crucial step in the drug discovery cycle. Recently, various deep learning-based methods design drugs by generating novel molecules from scratch, avoiding traversing large-scale drug libraries. However, they depend on scarce experimental data or time-consuming docking simulation, leading to overfitting issues with limited training data and slow generation speed. In this study, we propose the zero-shot drug design method DESERT (Drug dEsign by SkEtching and geneRaTing). Specifically, DESERT splits the design process into two stages: sketching and generating, and bridges them with the molecular shape. The two-stage fashion enables our method to utilize the large-scale molecular database to reduce the need for experimental data and docking simulation. Experiments show that DESERT achieves a new state-of-the-art at a fast speed.
研究动机与目标
- 解决现有深度学习方法在从头药物设计中数据依赖性强、速度慢且易过拟合的局限性。
- 减少在 3D 药物生成中对昂贵的实验生物活性数据和耗时的对接模拟的依赖。
- 通过将分子形状作为蛋白质-配体互补性的结构先验,实现零样本药物设计。
- 开发一种两阶段框架——草图绘制与生成——以提升在多种蛋白质靶标上的效率与泛化能力。
- 在无需目标特异性微调或大规模标注数据的情况下,实现高质量、多样化且快速的药物候选物生成。
提出的方法
- 将药物设计过程划分为两个阶段:首先绘制与靶标口袋互补的分子形状,随后从这些形状生成 3D 分子结构。
- 使用在 ZINC 数据库中 1 亿对分子-形状数据上预训练的生成模型(Shape2Mol),将绘制的形状映射为 3D 分子结构。
- 以分子形状作为结构先验,连接草图绘制与生成阶段,假设形状互补性可预测生物活性。
- 仅在后处理阶段使用对接模拟,避免在生成过程中因对接模拟的性能瓶颈与不准确性而影响结果。
- 在初始评估中采用贪婪解码策略且不进行后处理,而在最终性能评估中应用标准后处理(如能量最小化)。
- 利用大规模、未绑定且具有药物样的分子数据库进行预训练,实现对新型蛋白质靶标的零样本泛化,无需微调。
实验结果
研究问题
- RQ1在零样本 3D 药物设计中,分子形状如何作为生物活性的可靠代理?
- RQ2减少对实验数据和对接模拟的依赖,对从头药物生成的速度与质量有何影响?
- RQ3两阶段框架(草图绘制后接基于形状的生成)是否能实现在 3D 药物设计中的最先进性能?
- RQ4在大规模多样化分子数据库上进行预训练,如何提升在未见蛋白质靶标上的泛化能力?
- RQ5基于形状的草图绘制是否能有效缩小分子搜索空间,同时保持高亲和力与多样化的药物候选物?
主要发现
- Desert 在测试集上经后处理后达到新的最先进 Vina 得分为 -9.410 kcal/mol,显著优于 3D SBDD 的 -7.584 kcal/mol。
- Desert 生成的分子多样性得分高达 0.908(后处理后),表明其在化学空间中实现了广泛探索。
- 即使不进行后处理,Desert 仍可实现 -6.148 kcal/mol 的 Vina 得分与 0.873 的多样性得分,展现出强大的内在设计能力。
- 性能随采样空间大小的增加而提升,基于形状的剪枝可将有效搜索空间从 200K 降低至 10K 个分子,同时保持高性能。
- Desert 在 100 个多样化的蛋白质靶标上表现出良好泛化能力,即使在实验数据有限或缺失的情况下,仍能生成多样且高亲和力的分子。
- 该方法无需微调或目标特异性数据即可实现高性能,证实其具备零样本泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。