[論文レビュー] RetroXpert: Decompose Retrosynthesis Prediction like a Chemist
RetroXpertは、化学者が思考するプロセスを模倣する、テンプレートフリーな逆合成予測フレームワークを提案する。この手法は、2段階のプロセスに分解する:(1) エッジ強化型グラフアテンションネットワーク(EGAT)を用いて反応中心を特定し、シンチロンを生成する。 (2) ロバストな反応物生成ネットワーク(RGN)を用いて、化学的に妥当な反応物を生成する。本手法はUSPTOデータセット上で最先端の性能を達成し、従来の手法と比較して顕著な向上を示すとともに、解釈可能で化学的に意味のある予測を提供する。
Retrosynthesis is the process of recursively decomposing target molecules into available building blocks. It plays an important role in solving problems in organic synthesis planning. To automate or assist in the retrosynthesis analysis, various retrosynthesis prediction algorithms have been proposed. However, most of them are cumbersome and lack interpretability about their predictions. In this paper, we devise a novel template-free algorithm for automatic retrosynthetic expansion inspired by how chemists approach retrosynthesis prediction. Our method disassembles retrosynthesis into two steps: i) identify the potential reaction center of the target molecule through a novel graph neural network and generate intermediate synthons, and ii) generate the reactants associated with synthons via a robust reactant generation model. While outperforming the state-of-the-art baselines by a significant margin, our model also provides chemically reasonable interpretation.
研究の動機と目的
- 既存の逆合成予測モデル、特にテンプレートベースおよびエンドツーエンドニューラル手法における解釈不能性とスケーラビリティの欠如に対処すること。
- 熟練化学者が分子を分解する方法を模倣するフレームワークを構築すること。具体的には、反応中心の特定と、体系的かつ逐次的な順序で反応物を生成すること。
- 不正なシンチロンを含むデータ拡張を用いることで、モデルのロバスト性と一般化性能を向上させること。
- 大規模な逆合成ベンチマークで最先端の性能を達成するとともに、化学的妥当性と解釈可能性を維持すること。
提案手法
- 本手法は、化学的知識と補助的な切断予測タスクを活用して、ターゲット分子内の潜在的反応中心を特定するエッジ強化型グラフアテンションネットワーク(EGAT)を用いる。
- シンチロンは、予測された反応中心に沿ってターゲット分子を分割することで生成され、反応物予測のための中間表現として機能する。
- 反応物生成ネットワーク(RGN)は、シンチロンに基づき固定順序で反応物を予測することで、一貫性があり化学的に意味のある生成順序を保証する。
- RGNは、合成的に生成された不正なシンチロンを含むデータ拡張を用いて訓練され、ロバスト性と一般化性能の向上が図られる。
- EGATとRGNの両コンponentsは、USPTOデータセット上でエンドツーエンドに訓練され、逆合成精度を最適化するために共同で最適化される。
- 本フレームワークはスケーラブルでテンプレートフリーであり、事前に定義された反応テンプレートに依存しないため、新しい反応経路の発見が可能である。
実験結果
リサーチクエスチョン
- RQ1化学者の推論を模倣する2段階の逆合成フレームワークは、エンドツーエンドニューラルモデルと比較して、より高い精度と解釈可能性を達成できるか?
- RQ2反応テンプレートに依存せずに、エッジ強化型グラフアテンションネットワークが化学的に関連する反応中心を効果的に特定できるか?
- RQ3不正なシンチロンを含むデータ拡張により、反応物生成モデルのロバスト性と一般化性能が向上するか?
- RQ4シンチロンに基づく逐次的反応物生成は、テンプレートフリーなモデルにおける無順序生成と比較して、より良い収束性と性能をもたらすか?
- RQ5本手法は、USPTO-fullのような大規模で現実世界の逆合成データセットにスケーリングできるか?
主な発見
- 反応タイプの事前確率を用いたUSPTO-50Kデータセットでは、RetroXpertはトップ1精度70.4%を達成し、GLN(63.2%)とSCROP(59.0%)を顕著に上回った。
- 反応タイプの事前確率を用いないUSPTO-50Kデータセットでは、RetroXpertはトップ1精度65.6%を達成し、GLN(52.6%)とSCROP(43.7%)を上回った。
- より大きなUSPTO-fullデータセットでは、RetroXpertはトップ1精度49.4%を達成し、小規模ベンチマークを超えた強力なスケーラビリティと一般化性能を示した。
- 補助タスクのガイダンスを有するEGATモデルは、局所的GNNが失敗する複雑な分子環境でも真の反応中心を正しく特定できた。
- RGNは高いロバスト性を示した。予測されたシンチロンが真値から逸脱しても、依然として正しい反応物を生成できた。
- 不正なシンチロンを用いたデータ拡張により、RGNの性能と一般化性能が向上し、モデルのロバスト性向上に有効であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。