Skip to main content
QUICK REVIEW

[論文レビュー] Assessing the Extrapolation Capability of Template-Free Retrosynthesis Models

Shuan Chen, Yousung Jung|arXiv (Cornell University)|Feb 29, 2024
Wastewater Treatment and Nitrogen Removal被引用数 4
ひとこと要約

本研究は、USPTO-480kから多様な分布外(OOD)反応データセットを構築することで、テンプレートフリー反応スティルシスモデルの外挿能力を評価し、これらのモデルが新規の反応テンプレートを生成することは可能であるものの、OOD反応におけるトップ10の正確一致精度は1%未満であり、予測された新規反応の半数以上が化学的に非現実的であることが明らかになった。研究結果は、今後のモデル設計において化学的妥当性を統合することで、未知の反応空間の信頼できる探索を可能にするべきであると提言する。

ABSTRACT

Despite the acknowledged capability of template-free models in exploring unseen reaction spaces compared to template-based models for retrosynthesis prediction, their ability to venture beyond established boundaries remains relatively uncharted. In this study, we empirically assess the extrapolation capability of state-of-the-art template-free models by meticulously assembling an extensive set of out-of-distribution (OOD) reactions. Our findings demonstrate that while template-free models exhibit potential in predicting precursors with novel synthesis rules, their top-10 exact-match accuracy in OOD reactions is strikingly modest (< 1%). Furthermore, despite the capability of generating novel reactions, our investigation highlights a recurring issue where more than half of the novel reactions predicted by template-free models are chemically implausible. Consequently, we advocate for the future development of template-free models that integrate considerations of chemical feasibility when navigating unexplored regions of reaction space.

研究の動機と目的

  • テンプレートフリー反応スティルシスモデルが、トレーニングデータの分布外の反応を正確に予測できるかどうかを評価すること。
  • テンプレートフリーモデルが生成する反応テンプレートの新規性と化学的妥当性が、分布外の設定においてどのように現れるかを調査すること。
  • これらのモデルが既知の反応テンプレートを超えて、真に新規で実現可能な合成経路を発見できる範囲を評価すること。
  • 現在のテンプレートフリーモデルが、特に未確認の反応空間において、化学的に妥当な新規反応を生成する際の限界を同定すること。

提案手法

  • USPTO-50kトレーニングセットと重複する一般化反応テンプレート(GRT)を一切持たない反応をUSPTO-480kテストセットから抽出することで、分布外(OOD)反応データセットを収集した。
  • GRTを用いてトレーニングデータ内の反応テンプレート分布を表現し、テンプレートの類似性に基づいてOOD反応を同定した。
  • トップ10の予測精度とラウンドトリップ精度の指標を用いて、3つの最先端のテンプレートフリーモデル(Transformer、Retroformer、Chemformer)を、分布内(ID)およびOOD反応の両方で評価した。
  • IDおよびOODの両セットにおけるトップ10予測の妥当性、一意性、新規性を分析し、外挿行動を評価した。
  • モデルが生成する新規反応テンプレートの質的分析を実施し、特に不審な官能基変換や離脱基パターンを焦点に、化学的妥当性を評価した。
  • モデルのOOD反応における性能を既知の反応ルールと比較することで、トレーニング分布を超えて一般化できるかどうかを評価した。
Figure 1: The workflow of collecting in-distribution (ID) and out-of-distribution (OOD) reactions
Figure 1: The workflow of collecting in-distribution (ID) and out-of-distribution (OOD) reactions

実験結果

リサーチクエスチョン

  • RQ1テンプレートフリー反応スティルシスモデルは、トレーニング中に観測されていない新規の反応テンプレートを用いる反応について、正確に合成経路を予測できるか?
  • RQ2テンプレートフリーモデルのトップ10予測精度は、分布内(ID)と分布外(OOD)反応の間でどのように異なるか?
  • RQ3テンプレートフリーモデルが生成する新規反応テンプレートのうち、化学的に妥当なものはどの程度の割合か?
  • RQ4テンプレートフリーモデルは、OODターゲットに対してIDターゲットよりもより一意的かつ新規の反応を生成するか?これは外挿を試みている証左である。
  • RQ5テンプレートフリーモデルが分布外設定で頻繁に生成する化学的に非現実的な反応パターンはどのようなものか?

主な発見

  • 全テスト対象のテンプレートフリーモデルが、分布外(OOD)反応においてトップ10の正確一致精度を1%未満にとどめ、既知の新規経路を再現する能力が極めて低いことが示された。
  • テンプレートフリーモデルがOOD反応で予測する新規反応の50%以上が化学的に非現実的であり、一般的な問題として求核剤が離脱基として機能している、またはC–N単結合が直接切断されていることが挙げられた。
  • 正確一致精度が低くても、テンプレートフリーモデルはOODターゲットに対してIDターゲットよりも一意的かつ新規の反応を生成しており、トレーニング分布を超えて外挿を試みている可能性を示唆している。
  • ChemformerはID反応で最高の妥当性(98.6%)を達成したが、一意性(15.6%)と新規性(1.4%)は最低であり、共通パターンに過剰適合していることが示された。
  • RetroformerとTransformerはChemformerよりもより多くの新規テンプレートを生成したが、OOD予測精度はそれに見合わず、真に新規な事例への一般化能力が低いことが示された。
  • 最良のモデル(Retroformer)のOOD反応におけるラウンドトリップ精度はたったの4.8%にとどまり、予測された前駆体から有効な反応経路を再構築する信頼性が極めて低いことが確認された。
Figure 2: Examples of (a) correctly predicted and (b) popular novel reaction templates generated by Transformer, Retroformer, and Chemformer. The number of reactions corresponding to each reaction template in the dataset or predicted by each model is written below each example reaction.
Figure 2: Examples of (a) correctly predicted and (b) popular novel reaction templates generated by Transformer, Retroformer, and Chemformer. The number of reactions corresponding to each reaction template in the dataset or predicted by each model is written below each example reaction.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。