Skip to main content
QUICK REVIEW

[論文レビュー] Predicting retrosynthetic pathways using a combined linguistic model and hyper-graph exploration strategy

Philippe Schwaller, Riccardo Petraglia|arXiv (Cornell University)|Oct 17, 2019
Machine Learning in Materials Science被引用数 10
ひとこと要約

本稿では、変換器ベースの分子言語モデルとハイパーグラフ探索戦略を組み合わせることで、合成経路を自動的に予測する新規の逆合成計画フレームワークを提示する。前向き予測尤度と分子単純性スコアを活用することで、1段階の逆合成予測において最先端の性能を達成し、ベイズ的スコアリングとビームサーチ走査を用いて最適な経路を同定する。

ABSTRACT

We present an extension of our Molecular Transformer architecture combined with a hyper-graph exploration strategy for automatic retrosynthesis route planning without human intervention. The single-step retrosynthetic model sets a new state of the art for predicting reactants as well as reagents, solvents and catalysts for each retrosynthetic step. We introduce new metrics (coverage, class diversity, round-trip accuracy and Jensen-Shannon divergence) to evaluate the single-step retrosynthetic models, using the forward prediction and a reaction classification model always based on the transformer architecture. The hypergraph is constructed on the fly, and the nodes are filtered and further expanded based on a Bayesian-like probability. We critically assessed the end-to-end framework with several retrosynthesis examples from literature and academic exams. Overall, the frameworks has a very good performance with few weaknesses due to the bias induced during the training process. The use of the newly introduced metrics opens up the possibility to optimize entire retrosynthetic frameworks through focusing on the performance of the single-step model only.

研究の動機と目的

  • 人為的介入なしにエンドツーエンドで自動化された逆合成計画システムの開発。
  • 手動でエンコードされた規則に依存するのではなく、データから学習することでルールベースのシステムを改善すること。
  • 既存のAIモデルがノイズの多いデータや無効な反応予測に対処する能力に欠けるという限界を是正すること。
  • 全逆合成フレームワークの最適化を目的とした、1段階モデルのパフォーマンスに焦点を当てた新しい評価指標の導入。
  • ビームサーチとハイパーグラフの刈り込みを用いることで、計算コストを低減しつつスケーラブルでデータ駆動型の逆合成を実現すること。

提案手法

  • ターゲット分子から反応物、試薬、溶媒、触媒を予測するための分子変換器アーキテクチャを用い、シーケンス・トゥ・シーケンス翻訳タスクとして学習する。
  • ノードを分子、ハイパーアークを反応物から生成物へつなぐ逆合成反応として表す、動的生成のハイパーグラフを構築する。
  • ベイズ的スコアリング関数を適用:$ S(\text{C} \Rightarrow \text{A}+\text{B}) = P(\text{A}+\text{B} \rightarrow \text{C}) \cdot \frac{s(\text{A}) \cdot s(\text{B})}{s(\text{C})} $、ここで $ P $ は前向き予測尤度、$ s $ はSCScoreに基づく単純性スコア。
  • 計算コストを抑えるためにビームサーチを採用し、各拡張段階でスコア上位の経路のみを保持する。
  • 前向き予測信頼度の高い経路を優先するために、前駆体集合のフィルタリングとクラスタリングを実施する。
  • すべての前駆体が市販可能である、最大ステップ数に達した、またはサイクルが検出された場合に経路を終了する。

実験結果

リサーチクエスチョン

  • RQ1変換器ベースのモデルは、無効な出力を最小限に抑えることで、1段階の逆合成予測において最先端のパフォーマンスを達成できるか?
  • RQ2ベイズ的スコアリング関数は、最適な合成経路に至るハイパーグラフ探索をどれほど効果的に導けるか?
  • RQ3カバレッジ、クラス多様性、ラウンドトリップ正確性、ジェンセン・ショーンハイマー・ダイバージェンスといった新しい評価指標は、全逆合成フレームワークのパフォーマンスをどれほど的確に反映・改善できるか?
  • RQ4刈り込みとクラスタリングを施したビームサーチは、複雑なケースにおいても計算複雑性を低減しながら高品質な経路を維持できるか?
  • RQ5このシステムの主な失敗モードは何か。また、それらはトレーニングデータのバイアスにどのように影響を受けるか?

主な発見

  • 1段階の逆合成モデルは、反応物、試薬、溶媒、触媒の予測において最先端のパフォーマンスを達成し、無効な候補生成の大幅な削減を実現した。
  • カバレッジ、クラス多様性、ラウンドトリップ正確性、ジェンセン・ショーンハイマー・ダイバージェンスといった新しい評価指標の導入により、単一ステップモデルの最適化が可能になり、エンドツーエンドのパフォーマンス向上が図れた。
  • ベイズ的スコアリングで誘導されるハイパーグラフ探索戦略は、より単純な前駆体に至る経路を効果的に優先し、経路の効率性を向上させた。
  • 刈り込みとクラスタリングを施したビームサーチは、木の複雑性を低減しながらも、複雑なケースにおいても高品質な経路発見を維持した。
  • 文献および学術的な逆合成問題において、本フレームワークは強く優れたパフォーマンスを示したが、わずかな欠陥はトレーニングデータのバイアスに起因する。
  • 拡張段階でのサイクル検出により、生産性のない経路が効果的に終了され、無限ループの発生を防ぎ、計算の安定性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。