Skip to main content
QUICK REVIEW

[论文解读] "Found in Translation": Predicting Outcomes of Complex Organic Chemistry Reactions using Neural Sequence-to-Sequence Models

Philippe Schwaller, Théophile Gaudin|arXiv (Cornell University)|Nov 13, 2017
Topic Modeling参考文献 30被引用 4
一句话总结

该论文提出了一种无需模板、端到端的神经序列到序列模型,将有机反应预测视为翻译任务,使用SMILES字符串表示。通过采用一种新颖且可扩展的分词方法,并完全基于数据驱动进行训练,该模型在USPTO数据集上实现了80.3%的top-1准确率,在更嘈杂的专利衍生数据集上达到65.4%,优于先前的最先进方法,且无需依赖反应模板或外部知识。

ABSTRACT

There is an intuitive analogy of an organic chemist's understanding of a compound and a language speaker's understanding of a word. Consequently, it is possible to introduce the basic concepts and analyze potential impacts of linguistic analysis to the world of organic chemistry. In this work, we cast the reaction prediction task as a translation problem by introducing a template-free sequence-to-sequence model, trained end-to-end and fully data-driven. We propose a novel way of tokenization, which is arbitrarily extensible with reaction information. With this approach, we demonstrate results superior to the state-of-the-art solution by a significant margin on the top-1 accuracy. Specifically, our approach achieves an accuracy of 80.1% without relying on auxiliary knowledge such as reaction templates. Also, 66.4% accuracy is reached on a larger and noisier dataset.

研究动机与目标

  • 解决基于规则和依赖模板的反应预测方法的局限性,这些方法需要专家知识,且在复杂反应空间中缺乏灵活性。
  • 探索序列到序列神经网络是否能够将有机化学反应建模为语言翻译任务,利用SMILES表示法。
  • 开发一种完全基于数据驱动的端到端模型,避免依赖手工制作的反应模板或外部化学知识。
  • 提高在复杂、真实世界反应数据集上的预测准确率,包括来自美国专利的嘈杂、单产物反应。
  • 证明神经网络能够直接从数据中学习有机化学的“语言”,实现自动反应产物预测。

提出的方法

  • 该模型采用编码器-解码器结构的序列到序列架构,基于表示反应物和产物的SMILES字符串进行端到端训练。
  • 提出一种新颖且可扩展的分词方案,除标准SMILES标记外,还整合了反应中心和官能团等反应特异性信息。
  • 模型采用注意力机制,动态聚焦于输入序列的相关部分,即使关键官能团在SMILES字符串中相距较远也能有效捕捉。
  • 训练完全基于数据驱动,未使用任何反应模板或外部化学规则,仅依赖大规模反应数据。
  • 推理阶段采用束搜索解码,并基于top-1预测概率推导置信度阈值,以评估模型的确定性。
  • 模型在两个基准数据集上进行评估:USPTO数据集(清洁、多步反应)和Lowe的专利衍生数据集(嘈杂、单产物反应)。

实验结果

研究问题

  • RQ1在原始SMILES字符串上端到端训练的神经序列到序列模型,是否能在预测有机反应结果方面优于基于模板的方法?
  • RQ2数据驱动、无模板的模型在复杂且嘈杂的真实世界反应数据(如美国专利中的反应)上,其泛化能力如何?
  • RQ3模型的预测置信度与准确率之间的相关性如何?是否可以利用置信度阈值识别不确定预测?
  • RQ4注意力机制在捕捉SMILES表示中相距较远官能团之间的长程依赖关系方面发挥何种作用?
  • RQ5在相同训练和测试条件下,该模型的性能与最先进方法相比如何?

主要发现

  • 该模型在USPTO数据集上实现了80.3%的top-1准确率,比之前最先进方法高出6.3个百分点。
  • 在更大、更嘈杂的单产物反应专利数据集上,该模型达到65.4%的top-1准确率,为该具有挑战性的基准设立了新基准。
  • 尽管未使用候选排序,该模型在USPTO测试集上的top-1准确率仍比WLDN模型高出6.3个百分点。
  • top-1预测置信度(通过束搜索概率衡量)在正确与错误预测之间表现出明显区分,可利用置信度阈值过滤不确定预测。
  • 在置信度阈值为0.83时,模型对70.2%的反应进行预测,准确率达到83.0%,同时对29.8%的案例选择不预测。
  • 注意力可视化结果证实,该模型能够学习聚焦于关键反应中心,并正确映射原子(如将[O-]映射为产物中的O),即使这些原子在SMILES字符串中相距较远。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。