Skip to main content
QUICK REVIEW

[論文レビュー] RetCL: A Selection-based Approach for Retrosynthesis via Contrastive Learning

Hankook Lee, Sung Soo Ahn|arXiv (Cornell University)|May 3, 2021
Machine Learning in Materials Science参考文献 36被引用数 7
ひとこと要約

本論文では、グラフニューラルネットワークと対照的学習(ハードネガティブマイニングを含む)を用いて、大規模な候補集合から商業的に入手可能な反応物を選択することで、レトロシンセシスを定式化する選択ベースのフレームワークRetCLを提案する。RetCLはUSPTO-50kで71.3%のトップ1正確一致精度を達成し、先行手法を著しく上回り、未学習の反応テンプレートに対しても効果的に一般化する。

ABSTRACT

Retrosynthesis, of which the goal is to find a set of reactants for synthesizing a target product, is an emerging research area of deep learning. While the existing approaches have shown promising results, they currently lack the ability to consider availability (e.g., stability or purchasability) of the reactants or generalize to unseen reaction templates (i.e., chemical reaction rules). In this paper, we propose a new approach that mitigates the issues by reformulating retrosynthesis into a selection problem of reactants from a candidate set of commercially available molecules. To this end, we design an efficient reactant selection framework, named RetCL (retrosynthesis via contrastive learning), for enumerating all of the candidate molecules based on selection scores computed by graph neural networks. For learning the score functions, we also propose a novel contrastive training scheme with hard negative mining. Extensive experiments demonstrate the benefits of the proposed selection-based approach. For example, when all 671k reactants in the USPTO {database} are given as candidates, our RetCL achieves top-1 exact match accuracy of $71.3\%$ for the USPTO-50k benchmark, while a recent transformer-based approach achieves $59.6\%$. We also demonstrate that RetCL generalizes well to unseen templates in various settings in contrast to template-based approaches.

研究の動機と目的

  • 既存のレトロシンセシスモデルが反応物の入手可能性を十分に考慮できず、未学習の反応テンプレートへの一般化に課題を抱えることの是正。
  • 実用的妥当性を保証するため、商業的に入手可能な分子の事前に定義された集合からの選択問題としてレトロシンセシスを再定式化。
  • テンプレートベースおよびテンプレートフリーのベースラインを上回る性能と頑健性を向上させるスケーラブルで汎用性の高いフレームワークの開発。
  • 各段階で実現可能で適切な反応物を提案できるように、マルチステップのレトロシンセシス計画への有効な統合を可能にする。
  • 大規模な候補集合における対照的学習のスケーラビリティ課題を、新規のハードネガティブマイニング戦略により克服する。

提案手法

  • レトロシンセシスを選択タスクに再定式化:ターゲット分子が与えられたとき、固定で大規模な商業的入手可能な分子の集合から反応物を選択する。
  • 製品および候補反応物の両方の分子埋め込みを、グラフニューラルネットワーク(GNN)を用いて計算する。
  • 製品と反応物の埋め込み間のコサイン類似度を用いて選択スコアを計算し、候補を順位付けする。
  • 正例(正しい)反応物-製品ペアを近づけ、負例ペアを遠ざける対照的学習の目的関数を用いてスコア関数を訓練する。
  • 困難な負例に焦点を当てることで、学習効率とモデルの識別能力を向上させるハードネガティブマイニングを統合する。
  • 最大671,518の候補反応物を効率的に処理できるスケーラブルなトレーニングパイプラインを設計し、USPTOのような大規模データセットへの展開を可能にする。

実験結果

リサーチクエスチョン

  • RQ1選択ベースのレトロシンセシスアプローチは、反応物の入手可能性を保証することで、正確性と実用性を向上させることができるか?
  • RQ2ハードネガティブマイニングを含む対照的学習は、未学習の反応テンプレートへの一般化をどのように向上させるか?
  • RQ3候補反応物のサブセットで学習したモデルが、はるかに大きなテスト候補集合にどの程度一般化できるか?
  • RQ4テンプレートフリー生成モデルと組み合わせた場合、提案フレームワークはマルチステップのレトロシンセシス計画をどの程度改善できるか?
  • RQ5既存の選択ベースおよび生成ベースの手法と比較して、RetCLの性能と推論速度はどのように異なるか?

主な発見

  • RetCLはUSPTO-50kベンチマークで71.3%のトップ1正確一致精度を達成し、最近のトランスフォーマー基盤手法(59.6%)を11.7%上回り、強力なベースライン(Chen et al., 2019)をも凌駆する。
  • 未学習の反応テンプレートに対しても良好に一般化し、USPTO-fullデータセットで39.9%の精度を達成した—これは、最先端のテンプレートベース手法(26.7%)を著しく上回る。
  • USPTO-50kから抽出された小さな候補集合(91,297分子)で学習したにもかかわらず、671,518分子の大幅に大きなテスト候補集合に対しても効果的に一般化し、分布シフトに対して頑健であることを示した。
  • マルチステップのレトロシンセシスにおいて、RetCLはテンプレートフリーのトランスフォーマー・モデルの成功率を、各段階で高品質で入手可能な反応物を提供することで、91.05%から96.84%まで向上させた。
  • RetCLは1回の推論で1秒未塔で結果を出力し、1つの予測に約6時間(6×10⁵回の前方評価)を要するBayesian-Retroを著しく上回る。
  • アブレーションスタディにより、特に大規模な候補設定下で、対照的学習とハードネガティブマイニングが性能に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。