Skip to main content
QUICK REVIEW

[论文解读] PrefixMol: Target- and Chemistry-aware Molecule Design via Prefix Embedding

Zhangyang Gao, Yuqi Hu|arXiv (Cornell University)|Feb 14, 2023
Computational Drug Discovery Methods被引用 4
一句话总结

PrefixMol 提出了一种统一的生成模型,用于分子设计,通过可学习的前缀嵌入联合控制目标结合亲和力(通过三维蛋白质口袋)和多种化学性质(例如,QED、LogP、SA、Lipinski)。通过将注意力机制条件化于这些前缀嵌入,该模型在单条件和多条件生成中均实现了强大的可控性,优于先前的方法,并通过注意力分析揭示了分子性质之间的相互依赖关系。

ABSTRACT

Is there a unified model for generating molecules considering different conditions, such as binding pockets and chemical properties? Although target-aware generative models have made significant advances in drug design, they do not consider chemistry conditions and cannot guarantee the desired chemical properties. Unfortunately, merging the target-aware and chemical-aware models into a unified model to meet customized requirements may lead to the problem of negative transfer. Inspired by the success of multi-task learning in the NLP area, we use prefix embeddings to provide a novel generative model that considers both the targeted pocket's circumstances and a variety of chemical properties. All conditional information is represented as learnable features, which the generative model subsequently employs as a contextual prompt. Experiments show that our model exhibits good controllability in both single and multi-conditional molecular generation. The controllability enables us to outperform previous structure-based drug design methods. More interestingly, we open up the attention mechanism and reveal coupling relationships between conditions, providing guidance for multi-conditional molecule generation.

研究动机与目标

  • 为解决在统一框架中生成同时满足靶向特异性结合亲和力和期望化学性质的分子的挑战。
  • 通过使用前缀嵌入作为条件提示,而非联合训练独立模型,克服多任务学习中的负迁移问题。
  • 实现在多种约束条件下(包括蛋白质-配体结合亲和力和关键类药性质)的精确、可控分子生成。
  • 通过注意力机制分析揭示分子条件之间的隐藏耦合关系。

提出的方法

  • 该模型采用可学习的前缀嵌入,将其注入自注意力机制的查询和键矩阵中,以基于靶向和化学条件来条件化生成过程。
  • 每个条件(如蛋白质口袋(VINA评分)、QED、LogP、SA以及Lipinski规则符合性)均通过辅助网络编码为独立的前缀嵌入。
  • 前缀嵌入作为上下文提示,影响注意力分布,并引导SMILES序列的自回归生成。
  • 通过基于梯度的扰动分析注意力机制,计算偏导数,揭示某一条件的变化如何影响其他条件的注意力权重。
  • 通过在不同条件间求和绝对偏导数,构建关系矩阵 R,可视化各性质之间的相互依赖关系。
  • 模型在扩展的 CrossDocked 数据集上进行训练,该数据集增加了分子性质标签,支持多个目标的联合优化。

实验结果

研究问题

  • RQ1统一的深度生成模型能否有效控制分子生成中的靶向结合亲和力和多种化学性质?
  • RQ2在结合多样化约束时,如何缓解多条件分子生成中的负迁移问题?
  • RQ3在条件生成过程中,不同分子性质之间的潜在耦合关系是什么?
  • RQ4注意力机制在多条件生成中在多大程度上揭示了条件之间的相互依赖性?

主要发现

  • PrefixMol 在生成具有期望结合亲和力(VINA评分)和化学性质的分子方面,优于以往基于结构的药物设计方法。
  • 该模型在单条件和多条件生成中均实现了强大的可控性,生成的性质值与用户指定的目标高度一致。
  • 在同时控制 QED 和 SA 时,模型实现了 5.0 的 Lipinski 得分,表明其对类药性规则的最优符合性。
  • VINA 结合亲和力对 QED、LogP 和 SA 的变化最为敏感,而非对其自身值敏感,这解释了为何多条件控制优于单条件优化。
  • 注意力机制揭示了 LogP 和 QED 是最相关的性质,关系矩阵中显示出强烈的交叉可控性。
  • 对生成分子的可视化显示其结构新颖性,相较于参考化合物,表明该模型生成的是真正新颖的高亲和力配体,而非简单修饰。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。