[论文解读] SemiRetro: Semi-template framework boosts deep retrosynthesis prediction
SemiRetro 提出了一种半模板框架,通过将完整反应模板分解为可重用的半模板,结合模板方法的准确性与无模板方法的可扩展性,实现了模板与无模板方法的平衡。该框架引入了有向关系图注意力(DRGAT)层用于反应中心识别,并采用自校正模块进行半模板分类。在仅使用150个半模板的情况下,SemiRetro 覆盖了98.9%的 USPTO-50k 数据集,在已知类别上达到74.7%的 top-1 准确率,在未知类别上达到73.1%的 top-1 准确率,性能优于基于模板和无模板的方法,在准确性、可扩展性和训练效率方面均达到最先进水平。
Recently, template-based (TB) and template-free (TF) molecule graph learning methods have shown promising results to retrosynthesis. TB methods are more accurate using pre-encoded reaction templates, and TF methods are more scalable by decomposing retrosynthesis into subproblems, i.e., center identification and synthon completion. To combine both advantages of TB and TF, we suggest breaking a full-template into several semi-templates and embedding them into the two-step TF framework. Since many semi-templates are reduplicative, the template redundancy can be reduced while the essential chemical knowledge is still preserved to facilitate synthon completion. We call our method SemiRetro, introduce a new GNN layer (DRGAT) to enhance center identification, and propose a novel self-correcting module to improve semi-template classification. Experimental results show that SemiRetro significantly outperforms both existing TB and TF methods. In scalability, SemiRetro covers 98.9\% data using 150 semi-templates, while previous template-based GLN requires 11,647 templates to cover 93.3\% data. In top-1 accuracy, SemiRetro exceeds template-free G2G 4.8\% (class known) and 6.0\% (class unknown). Besides, SemiRetro has better training efficiency than existing methods.
研究动机与目标
- 解决基于模板方法在准确性与无模板方法在可扩展性之间的权衡问题,用于逆合成预测。
- 在保留关键化学知识以提升合成子补全能力的同时,减少模板冗余。
- 通过将半模板整合到两阶段无模板框架中,提升模型可解释性与训练效率。
- 通过新型神经组件——DRGAT 和自校正模块,提升反应中心识别与半模板分类性能。
- 在 USPTO-50k 基准测试中,实现准确性与可扩展性的最先进性能。
提出的方法
- 将完整反应模板分解为更简单、可重用的半模板,以减少冗余,同时保留化学知识。
- 将半模板整合到两阶段无模板框架中:首先识别反应中心(中心识别),然后完成合成子(合成子补全)。
- 提出有向关系图注意力网络(DRGAT),以增强分子特征表示,提升中心识别的准确性。
- 引入一个带有可学习变换器和先验分布过滤的自校正模块,以优化半模板分类并提高预测可靠性。
- 使用结合中心识别与合成子补全的 top-k 预测结果的概率树,生成端到端的逆合成结果。
- 应用残差连接算法,从合成子和预测的残基重构反应物。
实验结果
研究问题
- RQ1半模板框架是否能有效平衡基于模板方法的准确性与无模板方法的可扩展性,用于逆合成预测?
- RQ2通过半模板减少模板冗余,在不牺牲准确率的前提下,能在多大程度上提升数据覆盖度与模型效率?
- RQ3与现有方法相比,DRGAT 和自校正模块的集成如何提升中心识别与半模板分类性能?
- RQ4与最先进模型相比,所提出的框架是否在不同类别(已知 vs. 未知反应类型)中均实现一致的性能提升?
- RQ5与完整模板或纯无模板方法相比,使用半模板在模型准确性、训练效率与可解释性之间存在何种权衡?
主要发现
- SemiRetro 仅使用150个半模板即覆盖了98.9%的 USPTO-50k 数据集,显著优于基于模板的 GLN(需11,647个模板覆盖93.3%的数据)。
- 在 top-1 准确率方面,SemiRetro 在已知类别上达到74.7%,在未知类别上达到73.1%,分别比无模板方法 G2G 提高4.8%和6.0%。
- 与未使用自校正模块的消融模型相比,自校正模块将 top-1 准确率提升了3.2%,证明其在提升预测可靠性方面具有关键作用。
- SemiRetro 的训练速度至少比 G2G、RetroXpert 和 GLN 快6倍,表明其在保持更高准确率的同时具备更优的训练效率。
- DRGAT 层在所有对比模型中实现了最高的中心识别准确率,对整体性能提升有显著贡献。
- 与 G2G 和 RetroXpert 等纯无模板模型相比,SemiRetro 通过半模板显式编码化学转化模式,显著提升了可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。