Skip to main content
QUICK REVIEW

[論文レビュー] G-MATT: Single-step Retrosynthesis Prediction using Molecular Grammar Tree Transformer

Guomin Zhang, Vipul Mann|arXiv (Cornell University)|May 4, 2023
Machine Learning in Materials ScienceMaterials Science被引用数 3
ひとこと要約

G-MATTは、分子構造を明示的な化学知見を持つ表現でエンコードする階層的SMILES文法ツリーを用いた、新しいツリーからシーケンスへのトランスフォーマーモデルを提案する。これにより、1段階の逆合成予測が顕著に向上する。USPTO-50Kデータセットにおいて、トップ1正解率51%、トップ10正解率79.1%、無効反応率1.5%、バイオアクティブ類似度74.8%を達成し、構造的および機能的官能基の情報を統合することで、標準的なSMILESベースのモデルを上回る性能を発揮する。

ABSTRACT

Various template-based and template-free approaches have been proposed for single-step retrosynthesis prediction in recent years. While these approaches demonstrate strong performance from a data-driven metrics standpoint, many model architectures do not incorporate underlying chemistry principles. Here, we propose a novel chemistry-aware retrosynthesis prediction framework that combines powerful data-driven models with prior domain knowledge. We present a tree-to-sequence transformer architecture that utilizes hierarchical SMILES grammar-based trees, incorporating crucial chemistry information that is often overlooked by SMILES text-based representations, such as local structures and functional groups. The proposed framework, grammar-based molecular attention tree transformer (G-MATT), achieves significant performance improvements compared to baseline retrosynthesis models. G-MATT achieves a promising top-1 accuracy of 51% (top-10 accuracy of 79.1%), invalid rate of 1.5%, and bioactive similarity rate of 74.8% on the USPTO- 50K dataset. Additional analyses of G-MATT attention maps demonstrate the ability to retain chemistry knowledge without relying on excessively complex model architectures.

研究の動機と目的

  • 逆合成予測において、分子構造や機能的官能基の情報を捉えるのに不十分なSMILESテキストベースの表現の限界を解消すること。
  • ドメイン特化の化学文法規則をディープラーニングモデルに統合し、解釈可能性と性能を向上させること。
  • 局所的な結合および機能的官能基の文脈を保持する階層的でツリー構造の分子表現を開発すること。
  • 化学的妥当性と低無効反応率を維持しながら、1段階の逆合成予測で最先端の性能を達成すること。
  • アテンション機構が、過度に複雑なアーキテクチャを必要とせずに、化学的知識を保持できることを示すこと。

提案手法

  • 分子がSMILES文法ツリーとして表現され、階層的な構造的関係が捉えられる、ツリーからシーケンスへのトランスフォーマー・アーキテクチャを採用する。
  • 各分子は、独自のSMILES文法を用いて解析され、原子、結合、分岐、環、ステレオケミストリーが明示的にエンコードされる。
  • エンコーダーは、ターゲット分子の文法ツリー表現を処理し、デコーダーはクロスアテンションを介して反応物のSMILES文字列に注目する。
  • 自己アテンションおよびクロスアテンション機構を活用し、ターゲットと予測された前駆体間の構造モチーフを一致させる。
  • 24のカスタム文法規則が、SMILESの階層的構造を定義し、原子、結合、分岐のコンponentsに正確にパースングを可能にする。
  • 標準的なシーケンスからシーケンスへの目的関数と交差エントロピー損失を用いて、USPTO-50Kデータセット上でエンドツーエンドに訓練される。

実験結果

リサーチクエスチョン

  • RQ1文法ベースの分子ツリー表現は、標準的なSMILES文字列モデルと比較して、逆合成予測の正確性と化学的妥当性を向上させることができるか?
  • RQ2階層的ツリー構造を用いる場合、トランスフォーマーモデル内のアテンション機構が、ターゲット分子とその前駆体との間に、化学的に意味のあるアライメントを学習できる程度は何か?
  • RQ3モデルアーキテクチャに明示的な化学文法規則を統合することで、無効反応率を低減しつつ高い予測精度を維持できるか?
  • RQ4標準ベンチマークにおいて、既存のテンプレートフリーおよびテンプレートベースの逆合成モデルと比較して、このモデルの性能はどの程度か?
  • RQ5アテンション可視化により、モデルが予測時に化学的に関連する官能基や反応中心に注目していることが確認できるか?

主な発見

  • G-MATTは、USPTO-50Kデータセットでトップ1正解率51%を達成し、ベースラインのSMILESベースのモデルを顕著に上回る。
  • トップ10正解率は79.1%に達し、妥当な逆合成経路のカバレッジが良好であることが示された。
  • 無効反応率はわずか1.5%であり、生成された前駆体の文法的および化学的正確性が非常に高いことが裏付けられた。
  • バイオアクティブ類似度は74.8%に達し、予測された前駆体がトレーニングセット内のバイオアクティブ化合物と構造的に類似していることが示された。
  • アテンション可視化により、モデルが反応中心、機能的官能基、ステレオケミストリーなどの化学的に関連する断片に注目していることが確認された。
  • 複雑なアーキテクチャの修正を必要とせず、高い性能を維持していることから、文法ベースのツリー表現そのものが学習効率を向上させていることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。