[論文レビュー] MARS: A Motif-based Autoregressive Model for Retrosynthesis Prediction
MARSは、反応中心を特定し、反応中心に化学的に意味のあるモチーフ(原子より大きく、離れる基団より小さい)を追加することで、合成片を完成させる、エンドツーエンドの自己回帰的グラフ生成モデルを提案する。この手法により予測の複雑さが軽減され、一般化性能が向上する。反応クラスが分かっている場合、トップ1精度で先行手法を最大5.5%上回る最先端の性能を達成している。
Retrosynthesis is a major task for drug discovery. It is formulated as a graph-generating problem by many existing approaches. Specifically, these methods firstly identify the reaction center, and break target molecule accordingly to generate synthons. Reactants are generated by either adding atoms sequentially to synthon graphs or directly adding proper leaving groups. However, both two strategies suffer since adding atoms results in a long prediction sequence which increases generation difficulty, while adding leaving groups can only consider the ones in the training set which results in poor generalization. In this paper, we propose a novel end-to-end graph generation model for retrosynthesis prediction, which sequentially identifies the reaction center, generates the synthons, and adds motifs to the synthons to generate reactants. Since chemically meaningful motifs are bigger than atoms and smaller than leaving groups, our method enjoys lower prediction complexity than adding atoms and better generalization than adding leaving groups. Experiments on a benchmark dataset show that the proposed model significantly outperforms previous state-of-the-art algorithms.
研究の動機と目的
- 既存の反応予測モデルが原子を1つずつ追加する(長大なシーケンス、高コスト)か、離れる基団を追加する(一般化性能が低い)という限界を是正すること。
- 統一的でエンドツーエンドのフレームワーク内で、反応中心の特定と合成片完成の共同学習を改善すること。
- 原子や完全な離れる基団ではなく、微細な化学的意味を持つ断片(モチーフ)を用いることで、モデルの一般化性能を向上させること。
- 多様な反応種別やデータセットにおいて、より高い精度と頑健性を達成すること。
提案手法
- モデルは、入力分子グラフを符号化するためのグラフニューラルネットワーク(GNN)と、順次的なグラフ変換操作を予測するための再帰的ニューラルネットワーク(RNN)を用いる。
- 2段階の自己回帰的生成プロセスを採用する:(1) 編集段階では、結合や原子を変更することで反応中心を同定し、(2) モチーフ追加段階では、事前に定義されたモチーフを追加して合成片を完成させる。
- モチーフは学習済みの反応から得た語彙から選択され、インターフェース原子に結合され、結合時に1つのノードに統合される。
- 合成片埋め込み(synthon embeddings)を用いて、編集段階の終了タイミングを決定し、生成の安定性と精度を向上させる。
- 反応中心の同定とモチーフベースの合成片完成をエンドツーエンドで同時に最適化するように学習する。
- モチーフの使用により、原子単位での生成に比べて予測シーケンス長が短縮されつつ、柔軟性と化学的妥当性を維持できる。
実験結果
リサーチクエスチョン
- RQ1反応予測において、原子レベルや離れる基団レベルの生成と比較して、モチーフベースの自己回帰的モデルはより優れた一般化性能を達成できるか?
- RQ2反応中心の同定とモチーフベースの合成片完成をエンドツーエンドで共同学習することで、2段階フレームワークに比べて予測精度がどのように向上するか?
- RQ3合成片埋め込みは、反応中心の正しく同定する能力や、重複操作を回避する能力にどの程度寄与しているか?
- RQ4反応クラスが提供されない状況(ゼロショットまたはフェイントショット設定)において、モデルの性能はいかがなものか?
- RQ5予測された反応中心が真値と異なる場合でも、最終生成物が有効であれば、化学的に妥当な反応物を生成できるか?
主な発見
- 反応クラスが分かっている場合、MARSはトップ1精度66.2%を達成し、MEGANとGraphRetroをそれぞれ5.5%、2.3%上回った。
- トップk精度では、k=1, 3, 5の各条件下で85.8%、90.2%、92.9%を達成し、GraphRetroと比較して4.3%以上高い。
- アブレーションスタディの結果、合成片埋め込みを削除すると、反応クラスが分かっている場合にトップ1精度が4.9%低下し、分かっていない場合に10.5%低下した。これは、合成片埋め込みが極めて重要な役割を果たしていることを示している。
- 可視化結果から、MARSは反応中心を正確に予測し、化学的に妥当なモチーフを追加していることが確認された。また、切断部位が真値と異なる場合でも、有効な生成物が得られるケースにおいても同様に妥当な結果を示した。
- モデルは反応クラス情報がなくても多様な反応種別で高い性能を維持しており、テンプレートベースの手法とは異なり、優れた一般化性能を示した。
- 専門家による化学的妥当性の検証では、反応中心の予測が誤っても、生成された反応物は高い合理性を示しており、失敗ケースでも化学的に妥当な生成物を出力していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。