Skip to main content
QUICK REVIEW

[论文解读] Retrosynthesis prediction enhanced by in-silico reaction data augmentation

Xu Zhang, Yiming Mo|arXiv (Cornell University)|Jan 31, 2024
Genomics and Phylogenetic Studies被引用 4
一句话总结

该论文提出RetroWISE,一种自增强框架,通过利用在真实成对数据上预训练的基模型,从无成对分子数据中生成计算模拟反应数据,从而提升逆合成预测性能。通过迭代生成高质量合成反应并微调模型,RetroWISE实现了最先进性能,在USPTO-50K数据集上将top-1准确率提升8.6%,并持续增强罕见转化类型的预测能力。

ABSTRACT

Recent advances in machine learning (ML) have expedited retrosynthesis research by assisting chemists to design experiments more efficiently. However, all ML-based methods consume substantial amounts of paired training data (i.e., chemical reaction: product-reactant(s) pair), which is costly to obtain. Moreover, companies view reaction data as a valuable asset and restrict the accessibility to researchers. These issues prevent the creation of more powerful retrosynthesis models due to their data-driven nature. As a response, we exploit easy-to-access unpaired data (i.e., one component of product-reactant(s) pair) for generating in-silico paired data to facilitate model training. Specifically, we present RetroWISE, a self-boosting framework that employs a base model inferred from real paired data to perform in-silico reaction generation and augmentation using unpaired data, ultimately leading to a superior model. On three benchmark datasets, RetroWISE achieves the best overall performance against state-of-the-art models (e.g., +8.6% top-1 accuracy on the USPTO-50K test dataset). Moreover, it consistently improves the prediction accuracy of rare transformations. These results show that Retro- WISE overcomes the training bottleneck by in-silico reactions, thereby paving the way toward more effective ML-based retrosynthesis models.

研究动机与目标

  • 解决逆合成建模中高质量成对反应数据(产物-反应物对)稀缺且难以获取的问题。
  • 通过从易于获取的无成对数据(如孤立产物或反应物)中生成合成的计算模拟反应数据,克服基于机器学习的逆合成方法在数据驱动方面的局限性。
  • 开发一种自增强框架,通过使用生成的反应数据重新训练和优化模型,实现模型性能的迭代提升。
  • 提升预测准确率,特别是针对现有数据集中代表性不足的罕见或低频转化类型。
  • 提升计算效率和可扩展性,以支持多步逆合成规划在实际场景中的部署。

提出的方法

  • 首先在真实成对反应数据(如USPTO中的数据)上训练一个基模型,以实现从产物预测反应物。
  • 利用训练好的基模型从公开来源或网络爬取的无成对数据(如孤立产物或反应物)中生成计算模拟的反应对。
  • 将生成的计算模拟反应用于增强原始训练数据,从而重新训练出更具鲁棒性和泛化能力的逆合成模型。
  • 该框架采用迭代训练机制:每次新模型生成更高质量的合成反应,再用于进一步优化模型,形成自增强循环。
  • 方法采用基于Transformer的架构,参数量约为4450万,专为推理阶段的计算与内存效率进行优化。
  • 通过基于根对齐的SMILES(R-SMILES)进行SMILES增强,以改善产物与反应物表征之间的对齐,减少序列生成中的多对一歧义。

实验结果

研究问题

  • RQ1当真实成对数据有限时,计算模拟反应数据增强是否能显著提升基于机器学习的逆合成模型性能?
  • RQ2一种通过迭代生成并基于合成反应重新训练的自增强框架,是否能超越现有最先进模型?
  • RQ3所提出方法是否能提升在训练数据中代表性不足的罕见或低频转化类型的预测准确率?
  • RQ4与传统成对数据相比,使用无成对数据(如孤立产物或反应物)在模型泛化能力和效率方面表现如何?
  • RQ5通过合成数据生成对模型进行迭代优化,在多大程度上提升了预测质量与鲁棒性?

主要发现

  • RetroWISE在USPTO-50K测试集上达到95.1%的top-1准确率,较基线模型提升8.6%。
  • 该模型在罕见转化类型上持续提升预测准确率,展现出对低频反应类型的更好泛化能力。
  • 在50次迭代后,top-1准确率从95.1%提升至96.1%,提升了1.1%,表明自增强优化的有效性。
  • 该框架保持了高计算效率,单个GPU上每个产物的推理时间在8.03 ms至115.07 ms之间。
  • 与先前基于Transformer的方法相比,该模型更轻量化(4450万参数 vs. RetroPrime的7540万参数),更易于部署。
  • 尽管分子相似度较高(Tc ≥ 0.95),部分预测仍存在错误——如立体化学错误或出现虚假试剂——凸显了模型泛化能力仍存在的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。