Skip to main content
QUICK REVIEW

[論文レビュー] Retrosynthesis prediction enhanced by in-silico reaction data augmentation

Xu Zhang, Yiming Mo|arXiv (Cornell University)|Jan 31, 2024
Genomics and Phylogenetic Studies被引用数 4
ひとこと要約

本稿では、実際のペアド反応データで事前学習されたベースモデルを用いて、非ペアド分子データからイン・シリコ反応データを生成することで、レトロシンセシス予測を向上させる自己強化フレームワーク、RetroWISEを紹介する。反復的な高品質な合成反応の生成とモデルの微調整により、RetroWISEは最先端の性能を達成し、USPTO-50Kデータセットにおいてトップ1の正確性を8.6%向上させるとともに、希少な転換反応の予測を一貫して向上させた。

ABSTRACT

Recent advances in machine learning (ML) have expedited retrosynthesis research by assisting chemists to design experiments more efficiently. However, all ML-based methods consume substantial amounts of paired training data (i.e., chemical reaction: product-reactant(s) pair), which is costly to obtain. Moreover, companies view reaction data as a valuable asset and restrict the accessibility to researchers. These issues prevent the creation of more powerful retrosynthesis models due to their data-driven nature. As a response, we exploit easy-to-access unpaired data (i.e., one component of product-reactant(s) pair) for generating in-silico paired data to facilitate model training. Specifically, we present RetroWISE, a self-boosting framework that employs a base model inferred from real paired data to perform in-silico reaction generation and augmentation using unpaired data, ultimately leading to a superior model. On three benchmark datasets, RetroWISE achieves the best overall performance against state-of-the-art models (e.g., +8.6% top-1 accuracy on the USPTO-50K test dataset). Moreover, it consistently improves the prediction accuracy of rare transformations. These results show that Retro- WISE overcomes the training bottleneck by in-silico reactions, thereby paving the way toward more effective ML-based retrosynthesis models.

研究の動機と目的

  • レトロシンセシスモデリングにおける高品質なペアド反応データ(生成物-反応物ペア)の不足とアクセス困難さに対処すること。
  • 機械学習ベースのレトロシンセシスにおけるデータドリブンな制限を克服し、容易に入手可能な非ペアドデータ(例:孤立生成物や反応物)から合成的・イン・シリコ反応データを生成すること。
  • 生成された反応を再トレーニングに用いてモデルを繰り返し改善する自己強化フレームワークの開発。
  • 特に、既存データセットに不足している希少または低頻度の転換反応の予測精度を向上させること。
  • マルチステップのレトロシンセシス計画における実世界での展開を念頭に、計算効率とスケーラビリティを向上させること。

提案手法

  • まず、実際のペアド反応データ(例:USPTOから)で事前学習されたベースモデルを用いて、生成物から反応物を予測する。
  • 訓練済みのベースモデルが、公開ソースやウェブスクリーピングで得た非ペアドデータ(例:孤立生成物や反応物)からイン・シリコ反応ペアを生成する。
  • 生成されたイン・シリコ反応データを元のトレーニングデータに追加し、より強固で汎用性の高いレトロシンセシスモデルの再トレーニングを可能にする。
  • フレームワークは反復的トレーニングを採用:各新しいモデルがより高品質な合成反応を生成し、それらを再びモデル改善に活用することで自己強化のループを形成する。
  • 推論時の計算およびメモリ効率を最適化するため、約4450万パラメータのトランスフォーマー基盤アーキテクチャを採用。
  • 生成物と反応物表現間の整合性を向上させるために、ルート基準のSMILES(R-SMILES)を用いたSMILES拡張を適用し、シーケンス生成における1対多の曖昧さを低減。

実験結果

リサーチクエスチョン

  • RQ1実際のペアドデータが限られる状況において、イン・シリコ反応データの拡張が機械学習ベースのレトロシンセシスモデルの性能を顕著に向上させ得るか?
  • RQ2反復的に合成反応を生成し、それらで再トレーニングを行う自己強化フレームワークが、既存の最先端モデルを上回る性能を発揮できるか?
  • RQ3本手法が、トレーニングデータに不足している希少または低頻度の反応タイプの予測精度を向上させるか?
  • RQ4孤立生成物や反応物といった非ペアドデータの使用は、従来のペアドデータと比較して、モデルの汎化性能と効率性においてどのように異なるか?
  • RQ5合成データ生成による反復的なモデル精錬が、予測品質と頑健性をどの程度向上させるか?

主な発見

  • RetroWISEはUSPTO-50Kテストセットにおいてトップ1の正確性が95.1%に達し、ベースライン比で8.6%の向上を示した。
  • 希少な転換反応の予測精度が一貫して向上し、低頻度の反応タイプにおける汎化性能の向上が確認された。
  • 50回の反復を経て、トップ1の正確性が1.1%(95.1%から96.1%)向上した。自己強化による精錬の有効性が裏付けられた。
  • 推論時間は1生成物あたり8.03 ms〜115.07 msの範囲で、1つのGPUを用いてUSPTO-50Kで高い計算効率を維持した。
  • 従来のトランスフォーマー基盤手法(RetroPrimeの7540万パラメータ)と比較して、より軽量なモデル(4450万パラメータ)であり、展開が容易である。
  • 高い分子類似度(Tc ≥ 0.95)であっても、誤ったステレオケミストリーの予測や不適切な試薬の生成といったエラーが一部で観察された。これは、モデルの汎化性能向上に向けた継続的な課題を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。