Skip to main content
QUICK REVIEW

[论文解读] Towards "AlphaChem": Chemical Synthesis Planning with Tree Search and Deep Neural Network Policies

Marwin Segler, Mike Preuß|arXiv (Cornell University)|Jan 31, 2017
Machine Learning in Materials Science参考文献 7被引用 15
一句话总结

该论文提出 AlphaChem,一种结合蒙特卡洛树搜索(MCTS)与深度神经网络策略的深度强化学习框架,用于自动化有机化学中的逆合成规划。通过将逆合成建模为马尔可夫决策过程,并利用在1700万条反应上训练的神经网络引导MCTS,该系统在2小时内实现95%的成功率,优于最先进的基于启发式的方法。

ABSTRACT

Retrosynthesis is a technique to plan the chemical synthesis of organic molecules, for example drugs, agro- and fine chemicals. In retrosynthesis, a search tree is built by analysing molecules recursively and dissecting them into simpler molecular building blocks until one obtains a set of known building blocks. The search space is intractably large, and it is difficult to determine the value of retrosynthetic positions. Here, we propose to model retrosynthesis as a Markov Decision Process. In combination with a Deep Neural Network policy learned from essentially the complete published knowledge of chemistry, Monte Carlo Tree Search (MCTS) can be used to evaluate positions. In exploratory studies, we demonstrate that MCTS with neural network policies outperforms the traditionally used best-first search with hand-coded heuristics.

研究动机与目标

  • 解决逆合成分析中难以处理的搜索空间和高分支因子问题,这些问题限制了传统专家系统的表现。
  • 克服逆合成中有效价值函数近似不足的问题,使截断搜索变得不可行。
  • 利用深度学习从完整的已发表化学文献中自动学习化学上直观的“关键步骤”。
  • 将蒙特卡洛树搜索与神经策略网络相结合,提升合成规划中的搜索效率与解的质量。
  • 证明深度学习与树搜索的结合在真实世界化学合成规划中可超越手工编码的启发式方法。

提出的方法

  • 将逆合成建模为马尔可夫决策过程(MDP),其中状态为分子集合,动作为逆合成转化。
  • 将分子表示为带标签的图,并将逆合成规则定义为图生成规则。
  • 训练一个带有ELU激活函数和Softmax输出的深度高速公路网络,以预测所有可能转化的概率分布(策略网络)。
  • 使用策略网络引导MCTS:选择策略概率高的动作,仅展开前50个最有希望的动作,并使用采样动作进行模拟。
  • 应用改进的UCT公式进行树选择,通过策略概率和访问次数平衡探索与利用。
  • 使用确定性转移函数,奖励为+1(若状态已解决,即所有分子均为已知的构建单元),-1(若为未解决的终止状态),其余情况为0。

实验结果

研究问题

  • RQ1在完整已发表化学文献上训练的深度神经网络,是否能比手工编码的启发式方法更有效地预测高质量的逆合成转化?
  • RQ2结合学习到的神经策略的蒙特卡洛树搜索,是否能显著缩小搜索空间并提升逆合成规划的解质量?
  • RQ3与基于专家启发式的传统最佳优先搜索相比,MCTS与深度神经策略的结合是否在成功率和计算效率方面表现更优?
  • RQ4神经策略是否能近似子图同构问题(规则应用所必需),从而减少昂贵的NP完全检查次数?
  • RQ5该框架是否可扩展至真实世界中的药物样分子,并在合理的时间预算内生成实用的合成路径?

主要发现

  • 使用深度神经网络策略的MCTS在2小时时间限制内解决了40个测试分子中的95%,显著优于基线的最佳优先搜索(BFS)与手工编码启发式方法,后者仅解决了22.5%。
  • MCTS+DNN方法的平均解题时间为每分子68秒,而速度更快但准确率较低的BFS+DNN方法为29秒。
  • 深度神经网络策略在转化预测任务中达到62%的top-1准确率和98%的top-50准确率,实现了对搜索空间的有效剪枝。
  • 通过仅展开每个状态的前50个动作,系统将子图同构检查次数从约17,370次减少至50次,显著提升了计算效率。
  • 使用深度神经网络策略的最佳优先搜索方法解决了87.5%的目标,且速度是MCTS+DNN的两倍,但MCTS+DNN在解覆盖范围和可扩展性方面表现更优。
  • 结果表明,将深度学习与MCTS结合可更有效地探索复杂的逆合成树,为自动化合成规划提供了有前景的路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。