Skip to main content
QUICK REVIEW

[论文解读] MARS: A Motif-based Autoregressive Model for Retrosynthesis Prediction

Jiahan Liu, Chaochao Yan|arXiv (Cornell University)|Sep 27, 2022
Computational Drug Discovery Methods被引用 10
一句话总结

MARS 提出了一种新颖的端到端自回归图生成模型,用于逆合成预测,通过在反应中心处添加化学上有意义的片段(大于原子但小于离去基团)来识别反应中心并完成合成子,从而降低预测复杂度并提升泛化能力。当已知反应类别时,该模型在准确率上达到当前最优水平,最高比先前方法提升5.5%。

ABSTRACT

Retrosynthesis is a major task for drug discovery. It is formulated as a graph-generating problem by many existing approaches. Specifically, these methods firstly identify the reaction center, and break target molecule accordingly to generate synthons. Reactants are generated by either adding atoms sequentially to synthon graphs or directly adding proper leaving groups. However, both two strategies suffer since adding atoms results in a long prediction sequence which increases generation difficulty, while adding leaving groups can only consider the ones in the training set which results in poor generalization. In this paper, we propose a novel end-to-end graph generation model for retrosynthesis prediction, which sequentially identifies the reaction center, generates the synthons, and adds motifs to the synthons to generate reactants. Since chemically meaningful motifs are bigger than atoms and smaller than leaving groups, our method enjoys lower prediction complexity than adding atoms and better generalization than adding leaving groups. Experiments on a benchmark dataset show that the proposed model significantly outperforms previous state-of-the-art algorithms.

研究动机与目标

  • 解决现有逆合成模型的局限性,这些模型要么逐个添加原子(序列长、复杂度高),要么添加离去基团(泛化能力差)。
  • 在统一的端到端框架中,提升反应中心识别与合成子补全的联合学习能力。
  • 通过使用片段——细粒度且具有化学意义的片段——而非原子或完整离去基团,增强模型的泛化能力。
  • 在多种反应类型和数据集上,实现更高的预测准确率与鲁棒性。

提出的方法

  • 该模型使用图神经网络(GNN)编码输入分子图,并使用循环神经网络(RNN)预测一系列图变换操作。
  • 采用两阶段自回归生成过程:(1) 编辑阶段通过修改键和原子来识别反应中心;(2) 添加片段阶段通过附加预定义的片段来完成合成子。
  • 片段从训练反应中学习得到的词汇表中选取,并在界面原子处连接,连接后合并的原子形成单一节点。
  • 使用合成子嵌入来指导模型判断何时结束编辑阶段,同时提升生成的稳定性和准确性。
  • 模型端到端训练,联合优化反应中心识别与基于片段的合成子补全。
  • 使用片段可显著缩短预测序列长度,同时保持灵活性与化学合理性。

实验结果

研究问题

  • RQ1基于片段的自回归模型在逆合成预测中是否能比基于原子或离去基团的生成方式实现更好的泛化能力?
  • RQ2与两阶段框架相比,端到端联合学习反应中心识别与基于片段的合成子补全,是否能显著提升预测准确率?
  • RQ3合成子嵌入在模型正确识别反应中心及避免冗余操作方面,其贡献程度如何?
  • RQ4当未提供反应类别时,模型在零样本或少样本设置下的表现如何?
  • RQ5只要最终产物有效,即使预测的反应中心与真实值不同,模型是否仍能生成化学上合理的反应物?

主要发现

  • 当已知反应类别时,MARS 的 top-1 准确率达到 66.2%,比 MEGAN 和 GraphRetro 分别高出 5.5% 和 2.3%。
  • 在 top-k 准确率方面,MARS 在 k=1、3 和 5 时分别达到 85.8%、90.2% 和 92.9%,较 GraphRetro 高出超过 4.3%。
  • 消融实验表明,移除合成子嵌入后,当已知反应类别时 top-1 准确率下降 4.9%,当未知时下降 10.5%,证明其关键作用。
  • 可视化结果证实,MARS 能够准确预测反应中心,并添加化学上合理的片段,即使断开位点与真实值不同,仍能生成有效产物。
  • 该模型在多种反应类型中泛化良好,即使在缺乏反应类别信息时仍保持高性能,而模板方法则不然。
  • 专家化学家验证表明,即使在反应中心预测错误的失败案例中,模型生成的反应物也具有高度合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。