Skip to main content
QUICK REVIEW

[论文解读] A Transformer-based Generative Model for De Novo Molecular Design

Wenlu Wang, Ye Wang|arXiv (Cornell University)|Oct 17, 2022
Computational Drug Discovery Methods被引用 15
一句话总结

该论文提出 cTransformer,一种基于条件 Transformer 的生成模型,用于从头分子设计,通过利用靶向特异性嵌入,生成基于蛋白靶标的新型、有效 SMILES 字符串。该模型在生成具有类药物性质和靶向特异性化合物方面达到最先进性能,具有高有效性、唯一性和新颖性,同时生成的分子占据与已知活性化合物相同的化学空间。

ABSTRACT

In the scope of drug discovery, the molecular design aims to identify novel compounds from the chemical space where the potential drug-like molecules are estimated to be in the order of 10^60 - 10^100. Since this search task is computationally intractable due to the unbounded search space, deep learning draws a lot of attention as a new way of generating unseen molecules. As we seek compounds with specific target proteins, we propose a Transformer-based deep model for de novo target-specific molecular design. The proposed method is capable of generating both drug-like compounds (without specified targets) and target-specific compounds. The latter are generated by enforcing different keys and values of the multi-head attention for each target. In this way, we allow the generation of SMILES strings to be conditional on the specified target. Experimental results demonstrate that our method is capable of generating both valid drug-like compounds and target-specific compounds. Moreover, the sampled compounds from conditional model largely occupy the real target-specific molecules' chemical space and also cover a significant fraction of novel compounds.

研究动机与目标

  • 为解决在药物发现中探索巨大化学空间($10^{60}$–$10^{100}$ 种潜在类药物分子)的计算不可行性。
  • 开发一种深度生成模型,可生成具有所需靶向特异性性质的新颖、有效且类药物的分子结构。
  • 利用注意力机制整合靶向嵌入,实现基于特定靶蛋白的分子条件生成。
  • 通过生成不仅有效、唯一,而且新颖且具有生物活性的化合物,超越现有模型。
  • 验证模型生成的分子是否占据与每个靶标已知活性化合物相同的子化学空间。

提出的方法

  • 该模型采用预训练的 Transformer 解码器架构,最初在 MOSES 数据集上进行训练,不包含靶向信息,以学习一般类药物 SMILES 模式。
  • 在条件微调阶段,将靶向特异性嵌入引入多头注意力机制,其中靶向作为键和值,以调节生成过程。
  • 模型在三个靶向特异性数据集(EGFR、HTR1A、S1PR1)上进行微调,将靶向嵌入注入解码器的自注意力和交叉注意力层。
  • SMILES 字符串以自回归方式逐 token 生成,确保语法正确性和化学有效性。
  • 通过有效性、唯一性(unique@10k)和新颖性(训练集中未出现的分子比例)等指标评估模型性能。
  • 使用具有 2048 位 FCFP6 指纹、166 位 MACCS 键和 319 个 RDKit 描述符的 QSAR 模型预测活性,并用于基准测试生成化合物的效力。

实验结果

研究问题

  • RQ1基于 Transformer 的模型是否能在无条件设置下生成有效、新颖且类药物的 SMILES 字符串?
  • RQ2将靶向特异性嵌入整合到注意力机制中,是否能有效引导生成具有所需靶向亲和力的分子?
  • RQ3生成的分子是否占据与靶标已知活性化合物相同的化学空间?
  • RQ4与条件 RNN 基线相比,该模型在生成活性化合物方面的表现如何?
  • RQ5生成的分子在保持高预测活性的同时,新颖性程度如何?

主要发现

  • cTransformer 模型在所有靶向上均实现了超过 88% 的有效性率,其中 EGFR 生成的 10,000 个分子中唯一性达 94%,HTR1A 为 89.6%,S1PR1 为 83.8%。
  • 模型展现出高新颖性,生成的分子中 90% 在 EGFR 训练集中未出现,HTR1A 为 78.7%,S1PR1 为 68.4%,显著优于 cRNN 基线。
  • QSAR 模型预测的皮尔逊相关系数在所有靶向上均超过 0.75,证实模型具备生成高预测活性化合物的能力。
  • cTransformer 生成的前 1,000–5,000 个最活跃化合物在所有三个靶向上,其预测活性分布显著优于 cRNN。
  • UMAP 可视化结果表明,生成的靶向特异性分子(深色)与真实靶向特异性化合物(浅色)占据相同的子化学空间,表明其具有生物相关性。
  • 已识别并可视化每个靶标最活跃的前 24 个生成化合物,证明了模型生成高潜力候选分子的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。