Skip to main content
QUICK REVIEW

[論文レビュー] SemiRetro: Semi-template framework boosts deep retrosynthesis prediction

Zhangyang Gao, Cheng Tan|arXiv (Cornell University)|Feb 12, 2022
Machine Learning in Materials Science被引用数 8
ひとこと要約

SemiRetro は、テンプレートベースの正確性とテンプレートフリーのスケーラビリティを組み合わせる半テンプレートフレームワークを提案する。全反応テンプレートを再利用可能な半テンプレートに分解し、反応中心の特定に指向性関係グラフ注意(DRGAT)層を統合し、半テンプレート分類に自己修正モジュールを導入することで、150個の半テンプレートで USPTO-50k データの98.9%をカバーしながら、精度、スケーラビリティ、学習効率の面で、テンプレートベースおよびテンプレートフリーの両手法を凌駉する最先端のトップ1精度(既知クラスで74.7%、未知クラスで73.1%)を達成した。

ABSTRACT

Recently, template-based (TB) and template-free (TF) molecule graph learning methods have shown promising results to retrosynthesis. TB methods are more accurate using pre-encoded reaction templates, and TF methods are more scalable by decomposing retrosynthesis into subproblems, i.e., center identification and synthon completion. To combine both advantages of TB and TF, we suggest breaking a full-template into several semi-templates and embedding them into the two-step TF framework. Since many semi-templates are reduplicative, the template redundancy can be reduced while the essential chemical knowledge is still preserved to facilitate synthon completion. We call our method SemiRetro, introduce a new GNN layer (DRGAT) to enhance center identification, and propose a novel self-correcting module to improve semi-template classification. Experimental results show that SemiRetro significantly outperforms both existing TB and TF methods. In scalability, SemiRetro covers 98.9\% data using 150 semi-templates, while previous template-based GLN requires 11,647 templates to cover 93.3\% data. In top-1 accuracy, SemiRetro exceeds template-free G2G 4.8\% (class known) and 6.0\% (class unknown). Besides, SemiRetro has better training efficiency than existing methods.

研究の動機と目的

  • 反応予測におけるテンプレートベース手法の正確性とテンプレートフリー手法のスケーラビリティのトレードオフを解消すること。
  • テンプレートの重複を低減しつつ、合成体完成のための必須の化学的知識を保持すること。
  • 半テンプレートを二段階のテンプレートフリー枠組みに統合することで、モデルの解釈可能性と学習効率を向上させること。
  • 新規ニューラルコンponents(DRGAT および自己修正モジュール)を用いて、反応中心の特定と半テンプレート分類を強化すること。
  • USPTO-50k ベンチマークにおいて、精度とスケーラビリティの両面で最先端のパフォーマンスを達成すること。

提案手法

  • 全反応テンプレートを簡素化され、再利用可能な半テンプレートに分解することで、冗長性を低減しつつ化学的知識を保持する。
  • 半テンプレートを二段階のテンプレートフリー枠組みに統合する:まず反応中心(中心特定)を同定し、次に合成体(シンセソン完成)を補完する。
  • 分子特徴表現を向上させ、より正確な中心特定を実現するため、指向性関係グラフ注意ネットワーク(DRGAT)を提案する。
  • 学習可能なトランスフォーマーと事前分布フィルタリングを備えた自己修正モジュールを導入し、半テンプレート分類を精緻化し、予測の信頼性を向上させる。
  • 中心特定とシンセソン完成の上位k個の予測を組み合わせた確率木を用いて、エンドツーエンドのレトロ合成結果を生成する。
  • 合成体と予測された残留部分から反応物を再構築するために、残留部分アタッチメントアルゴリズムを適用する。

実験結果

リサーチクエスチョン

  • RQ1半テンプレートフレームワークは、反応予測におけるテンプレートベース手法の正確性とテンプレートフリー手法のスケーラビリティを効果的にバランスできるか?
  • RQ2半テンプレートによるテンプレートの冗長性低減は、正確性を損なわず、データカバレッジとモデル効率をどの程度向上できるか?
  • RQ3DRGAT および自己修正モジュールの統合は、従来手法と比較して、中心特定と半テンプレート分類をどの程度向上させるか?
  • RQ4提案フレームワークは、既知クラスと未知クラスの両方で、最先端モデルと比較して一貫した性能向上を達成できるか?
  • RQ5完全テンプレートや完全テンプレートフリーのアプローチと比較して、半テンプレートを用いることで、モデルの正確性、学習効率、解釈可能性の間でどのようなトレードオフが生じるか?

主な発見

  • SemiRetro は、150個の半テンプレートで USPTO-50k データセットの98.9%をカバーし、テンプレートベースの GLN が93.3%をカバーするためには11,647個のテンプレートを必要とするのに対し、顕著に優れた性能を示した。
  • トップ1精度において、SemiRetro は既知クラスで74.7%、未知クラスで73.1%を達成し、テンプレートフリーの G2G よりもそれぞれ4.8%、6.0%高い。
  • 自己修正モジュールを搭載したモデルは、その欠損モデル(ablated model)と比較してトップ1精度が3.2%向上し、予測信頼性の向上に不可欠な役割を果たしていることが示された。
  • SemiRetro は、G2G や RetroXpert よりも少なくとも6倍速く学習が可能であり、高い正確性を維持しながらも、優れた学習効率を示した。
  • DRGAT レイヤーは、比較対象モデルの中で最高の中心特定精度を達成し、全体のパフォーマンス向上に寄与した。
  • G2G や RetroXpert といった完全テンプレートフリーのモデルと比較して、半テンプレートを明示的に組み込むことで、SemiRetro は解釈可能性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。