Skip to main content
QUICK REVIEW

[论文解读] A 3D Generative Model for Structure-Based Drug Design

Shitong Luo, Jiaqi Guan|arXiv (Cornell University)|Mar 20, 2022
Computational Drug Discovery Methods参考文献 17被引用 7
一句话总结

该论文提出一种3D生成模型,通过旋转不变图神经网络建模空间上下文,在蛋白质结合位点周围三维空间中估计原子出现的概率。该模型采用自回归采样方案,生成具有高结合亲和力、结构多样且符合药物特性的有效分子,优于基于图的基线方法在连接子设计任务中的分子相似性和恢复率表现。

ABSTRACT

We study a fundamental problem in structure-based drug design -- generating molecules that bind to specific protein binding sites. While we have witnessed the great success of deep generative models in drug design, the existing methods are mostly string-based or graph-based. They are limited by the lack of spatial information and thus unable to be applied to structure-based design tasks. Particularly, such models have no or little knowledge of how molecules interact with their target proteins exactly in 3D space. In this paper, we propose a 3D generative model that generates molecules given a designated 3D protein binding site. Specifically, given a binding site as the 3D context, our model estimates the probability density of atom's occurrences in 3D space -- positions that are more likely to have atoms will be assigned higher probability. To generate 3D molecules, we propose an auto-regressive sampling scheme -- atoms are sampled sequentially from the learned distribution until there is no room for new atoms. Combined with this sampling scheme, our model can generate valid and diverse molecules, which could be applicable to various structure-based molecular design tasks such as molecule sampling and linker design. Experimental results demonstrate that molecules sampled from our model exhibit high binding affinity to specific targets and good drug properties such as drug-likeness even if the model is not explicitly optimized for them.

研究动机与目标

  • 解决基于字符串和图的生成模型在捕捉分子与蛋白质结合位点之间三维空间相互作用方面的局限性。
  • 开发一种3D生成模型,学习在给定3D蛋白质结合位点上下文中原子类型和位置的概率分布。
  • 仅利用3D结构信息,实现对特定蛋白质靶标具有强结合能力的多样化、有效且符合药物特性的分子生成。
  • 将模型的应用范围扩展至基于结构的设计任务(如从头分子生成和连接子设计),而无需针对特定任务进行微调。

提出的方法

  • 该模型使用旋转和转移等变神经网络来估计条件概率密度 p(e, r|C),其中 e 为原子类型,r 为3D坐标,C 为3D蛋白质结合位点。
  • 采用基于旋转不变图神经网络的3D上下文编码器,对结合位点中每个查询坐标 r 的空间上下文进行编码。
  • 通过自回归采样算法,按顺序将原子逐步添加到正在生长的分子中,每一步均基于更新后的上下文条件来确定下一个原子的位置和类型。
  • 采样过程持续进行,直到无法再添加原子为止,通过迭代优化确保空间一致性和分子有效性。
  • 该模型无需后处理或潜在变量模型(如VAEs或GANs),可直接从学习到的3D分布中实现更简单的多模态采样。
  • 该方法在从头分子生成和连接子预测任务上进行了评估,且无需针对特定任务进行调整。

实验结果

研究问题

  • RQ1能否通过估计三维空间中原子出现概率的3D生成模型,为特定蛋白质结合位点生成有效、多样化且具有高亲和力的分子?
  • RQ2自回归采样方案在生成空间一致且化学上有效的分子方面,与非自回归或基于后处理的方法相比表现如何?
  • RQ3该模型在未显式优化药物样性指标(如QED、SA评分)的情况下,能在多大程度上生成具有高药物样性的分子?
  • RQ4该模型能否在不进行微调或架构修改的情况下,泛化至基于结构的设计任务(如连接子设计)?

主要发现

  • 生成的分子在结合亲和力评分方面达到与参考分子相当或更优的水平,Vina评分表明其与靶蛋白具有强结合能力。
  • 即使未显式优化,生成分子在QED(定量估计药物样性)和SA(合成可及性)评分方面也表现优异。
  • 在连接子预测任务中,该模型实现了48.33%的测试分子恢复率,优于DeLinker的40.00%,且平均相似度更高(0.701 vs. 0.612)。
  • 该模型的中位Vina评分为-8.575 kcal/mol,与DeLinker相当,表明其在完全基于3D信息的前提下,结合亲和力表现相当。
  • 定性分析显示,生成分子与参考分子共享关键亚结构,并保持与结合位点的整体结构相似性。
  • 自回归采样方案在无需引入潜在变量复杂性的情况下实现了多模态生成,展示了在分子设计中鲁棒且灵活的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。