[论文解读] G-MATT: Single-step Retrosynthesis Prediction using Molecular Grammar Tree Transformer
G-MATT 提出了一种新颖的树到序列的 Transformer 模型,利用层次化的 SMILES 语法树对分子结构进行编码,显式地表示化学信息,显著提升了单步逆合成预测的性能。该模型在 USPTO-50K 数据集上实现了 51% 的 top-1 准确率、79.1% 的 top-10 准确率、1.5% 的无效率以及 74.8% 的生物活性相似度,通过整合结构和官能团信息,优于基于标准 SMILES 的模型。
Various template-based and template-free approaches have been proposed for single-step retrosynthesis prediction in recent years. While these approaches demonstrate strong performance from a data-driven metrics standpoint, many model architectures do not incorporate underlying chemistry principles. Here, we propose a novel chemistry-aware retrosynthesis prediction framework that combines powerful data-driven models with prior domain knowledge. We present a tree-to-sequence transformer architecture that utilizes hierarchical SMILES grammar-based trees, incorporating crucial chemistry information that is often overlooked by SMILES text-based representations, such as local structures and functional groups. The proposed framework, grammar-based molecular attention tree transformer (G-MATT), achieves significant performance improvements compared to baseline retrosynthesis models. G-MATT achieves a promising top-1 accuracy of 51% (top-10 accuracy of 79.1%), invalid rate of 1.5%, and bioactive similarity rate of 74.8% on the USPTO- 50K dataset. Additional analyses of G-MATT attention maps demonstrate the ability to retain chemistry knowledge without relying on excessively complex model architectures.
研究动机与目标
- 为解决基于 SMILES 文本表示在捕捉逆合成预测中关键化学结构和官能团信息方面的局限性。
- 将领域特定的化学语法规则整合到深度学习模型中,以提升可解释性和性能。
- 开发一种分层的、树状的分子表示方法,以保留局部键合和官能团上下文信息。
- 在保持化学合理性与低无效反应率的前提下,实现单步逆合成预测的最先进性能。
- 证明注意力机制可在不依赖复杂架构的情况下,保留化学知识。
提出的方法
- 该模型采用树到序列的 Transformer 架构,其中分子以 SMILES 语法树的形式表示,以捕捉分层的结构关系。
- 每个分子通过自定义的 SMILES 语法被解析为树结构,显式编码原子、化学键、分支、环结构和立体化学信息。
- 编码器处理目标分子的语法树表示,而解码器通过交叉注意力机制关注反应物的 SMILES 字符串。
- 该模型利用自注意力和交叉注意力机制,对齐目标分子与预测前体之间的结构片段。
- 一组自定义的 24 条语法规则定义了 SMILES 的分层结构,使分子能被精确解析为原子、化学键和分支组件。
- 该架构在 USPTO-50K 数据集上端到端训练,采用标准的序列到序列目标函数和交叉熵损失。
实验结果
研究问题
- RQ1与基于标准 SMILES 字符串建模相比,基于语法规则的分子树表示是否能提升逆合成预测的准确率和化学合理性?
- RQ2在使用分层树结构时,Transformer 模型中的注意力机制在多大程度上能学习到目标分子与其前体之间的化学上有意义的对齐?
- RQ3将显式的化学语法规则整合到模型架构中,是否能降低无效反应率,同时保持高预测准确率?
- RQ4该模型在标准基准测试中与现有的无模板和有模板的逆合成模型相比,性能如何?
- RQ5注意力可视化是否能证实模型在预测过程中聚焦于化学上相关的官能团和反应中心?
主要发现
- G-MATT 在 USPTO-50K 数据集上实现了 51% 的 top-1 准确率,显著优于基线的 SMILES 基模型。
- 该模型达到 79.1% 的 top-10 准确率,表明其对合理逆合成路径具有良好的覆盖能力。
- 无效反应率仅为 1.5%,表明生成的前体在句法和化学上均具有高度正确性。
- 生物活性相似度达到 74.8%,表明预测的前体与训练集中生物活性化合物在结构上高度相似。
- 注意力可视化证实,模型会关注化学上相关的片段,如反应中心、官能团和立体化学中心。
- 该模型在无需复杂架构修改的情况下保持高性能,表明仅通过基于语法的树表示即可提升学习效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。