Skip to main content
QUICK REVIEW

[论文解读] RetroXpert: Decompose Retrosynthesis Prediction like a Chemist

Chaochao Yan, Qianggang Ding|arXiv (Cornell University)|Nov 4, 2020
Machine Learning in Materials Science被引用 6
一句话总结

RetroXpert 提出了一种新颖的无模板反应预测框架,通过将任务分解为两个步骤来模拟化学家的思维过程:(1) 利用边缘增强图注意力网络(EGAT)识别反应中心以生成合成子,(2) 利用鲁棒的反应物生成网络(RGN)生成化学上有效的反应物。该方法在 USPTO 数据集上实现了最先进性能,显著优于先前方法,同时提供可解释的、具有化学意义的预测结果。

ABSTRACT

Retrosynthesis is the process of recursively decomposing target molecules into available building blocks. It plays an important role in solving problems in organic synthesis planning. To automate or assist in the retrosynthesis analysis, various retrosynthesis prediction algorithms have been proposed. However, most of them are cumbersome and lack interpretability about their predictions. In this paper, we devise a novel template-free algorithm for automatic retrosynthetic expansion inspired by how chemists approach retrosynthesis prediction. Our method disassembles retrosynthesis into two steps: i) identify the potential reaction center of the target molecule through a novel graph neural network and generate intermediate synthons, and ii) generate the reactants associated with synthons via a robust reactant generation model. While outperforming the state-of-the-art baselines by a significant margin, our model also provides chemically reasonable interpretation.

研究动机与目标

  • 为解决现有逆合成预测模型在可解释性和可扩展性方面的不足,特别是基于模板和端到端神经网络的方法。
  • 开发一种框架,模拟专家化学家通过识别反应中心并以结构化、顺序化方式生成反应物的分子分解过程。
  • 通过在训练数据中引入无效合成子来增强数据,提升模型的鲁棒性和泛化能力。
  • 在大规模逆合成基准上实现最先进性能,同时保持化学合理性与可解释性。

提出的方法

  • 该方法使用边缘增强图注意力网络(EGAT),通过利用化学知识和辅助的断键预测任务,识别目标分子中的潜在反应中心。
  • 通过在预测的反应中心处切割目标分子生成合成子,作为反应物预测的中间表示。
  • 反应物生成网络(RGN)基于合成子按固定顺序预测反应物,确保生成序列的一致性和化学意义。
  • RGN 通过数据增强进行训练,其中包含人工生成的、无效的合成子,以提升鲁棒性和泛化能力。
  • 模型在 USPTO 数据集上进行端到端训练,EGAT 和 RGN 组件联合优化以提升逆合成预测的准确性。
  • 该框架具有可扩展性且无需模板,避免依赖预定义的反应模板,从而能够发现新型反应路径。

实验结果

研究问题

  • RQ1一种模仿化学家推理过程的两阶段逆合成框架,是否能在准确性和可解释性方面超越端到端神经网络模型?
  • RQ2在不依赖反应模板的前提下,边缘增强图注意力网络在识别化学上相关的反应中心方面效果如何?
  • RQ3通过在训练数据中引入错误的合成子,能否提升反应物生成模型的鲁棒性和泛化能力?
  • RQ4基于合成子的顺序化反应物生成方式,是否相比无序生成在无模板模型中能带来更好的收敛性和性能?
  • RQ5所提出的方法在大规模真实世界逆合成数据集(如 USPTO-full)上是否具备良好的可扩展性?

主要发现

  • 在带有反应类型先验的 USPTO-50K 数据集上,RetroXpert 的 top-1 准确率达到 70.4%,显著优于 GLN(63.2%)和 SCROP(59.0%)。
  • 在不带反应类型先验的 USPTO-50K 数据集上,RetroXpert 的 top-1 准确率为 65.6%,超过 GLN(52.6%)和 SCROP(43.7%)。
  • 在更大的 USPTO-full 数据集上,RetroXpert 的 top-1 准确率为 49.4%,展现出强大的可扩展性和超越小型基准的泛化能力。
  • 带有辅助任务引导的 EGAT 模型即使在局部 GNN 失效的复杂分子环境中,也能成功识别真实的反应中心。
  • RGN 展现出高度鲁棒性:即使预测的合成子与真实值存在偏差,仍能生成正确的反应物。
  • 使用无效合成子进行数据增强可提升 RGN 的性能与泛化能力,证实其在增强模型鲁棒性方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。