Skip to main content
QUICK REVIEW

[论文解读] Augmented Transformer Achieves 97% and 85% for Top5 Prediction of Direct and Classical Retro-Synthesis.

Igor V. Tetko, Pavel Karpov|arXiv (Cornell University)|Mar 5, 2020
Computational Drug Discovery Methods参考文献 33被引用 9
一句话总结

本文提出了一种增强的Transformer模型,通过在输入和目标数据中应用SMILES序列增强,减少数据记忆化现象并提升泛化能力,从而改善逆合成预测。该方法在USPTO-MIT分离数据集上实现了97%的Top-5准确率,在USPTO-50k测试集上对经典逆合成中最大片段的预测准确率达到85.4%。

ABSTRACT

We investigated the effect of different augmentation scenarios on predicting (retro)synthesis of chemical compounds using SMILES representation. We showed that augmentation of not only input sequences but also, importantly, of the target data eliminated the effect of data memorization by neural networks and improved their generalization performance for prediction of new sequences. The Top-5 accuracy was 85.4% for the prediction of the largest fragment (thus identifying principal transformation for classical retro-synthesis) for USPTO-50k test dataset and was achieved by a combination of SMILES augmentation and beam search. The same approach also outperformed best published results for prediction of direct reactions from the USPTO-MIT test set. Our model achieved 90.4% Top-1 and 96.5% Top-5 accuracy for its most challenging mixed set and 97% Top-5 accuracy for the USPTO-MIT separated set. The appearance frequency of the most abundantly generated SMILES was well correlated with the prediction outcome and can be used as a measure of the quality of reaction prediction.

研究动机与目标

  • 解决神经网络在化学反应预测中的数据记忆化问题。
  • 通过序列增强提升逆合成预测中的泛化性能。
  • 提升在经典逆合成中识别主要转化步骤的Top-5准确率。
  • 评估输入和目标数据增强对模型泛化能力的影响。
  • 通过SMILES生成频率与预测质量的相关性,提升模型可解释性。

提出的方法

  • 对输入和目标序列同时应用SMILES序列增强,以减少记忆化效应。
  • 在推理过程中使用束搜索(beam search)以提升预测的多样性与准确性。
  • 基于增强后的数据训练基于Transformer的模型,以增强泛化能力。
  • 通过基准数据集上的Top-1和Top-5准确率来衡量预测质量。
  • 分析最常生成的SMILES的出现频率,作为预测可靠性的代理指标。
  • 在USPTO-50k和USPTO-MIT测试集上评估性能,包括混合与分离的反应集。

实验结果

研究问题

  • RQ1同时增强输入和目标序列是否能提升逆合成预测中的泛化能力?
  • RQ2数据增强是否能减少神经网络在化学反应预测中的记忆化现象?
  • RQ3SMILES增强对识别经典逆合成中最大片段的Top-5准确率有何影响?
  • RQ4束搜索与数据增强如何协同作用以提升预测性能?
  • RQ5生成SMILES的频率能否作为预测质量的可靠指标?

主要发现

  • 该模型在USPTO-MIT分离测试集上对直接反应预测的Top-5准确率达到97%。
  • 在USPTO-50k测试集上,该模型对最大片段预测的Top-5准确率达到85.4%,表明其能有效识别主要转化步骤。
  • 该模型在USPTO-MIT测试集上的表现优于以往发表的结果,在最具挑战性的混合数据集上实现了90.4%的Top-1准确率和96.5%的Top-5准确率。
  • 最常生成的SMILES的出现频率与正确预测结果存在强相关性。
  • 对输入和目标序列进行联合增强显著减少了记忆化现象,并提升了模型的泛化能力。
  • SMILES增强与束搜索的结合是实现在多个基准上SOTA性能的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。