Skip to main content
QUICK REVIEW

[論文レビュー] Retrieval-based Controllable Molecule Generation

Zichao Wang, Weili Nie|arXiv (Cornell University)|Aug 23, 2022
Computational Drug Discovery Methods被引用数 8
ひとこと要約

本稿では、タスク固有の微調整を必要とせず、少量の例示分子を用いて事前学習済み生成モデルをガイドする、制御可能な分子生成のためのリtrievalベースのフレームワークRetMolを提案する。自己教師付き類似度目的関数と反復的精錬を介して入力分子と例示分子を統合することで、SARS-CoV-2主要プロテアーゼ阻害剤の設計など、困難な現実世界のシナリオを含む、望ましい性質を持つ分子の生成において最先端の性能を達成する。

ABSTRACT

Generating new molecules with specified chemical and biological properties via generative models has emerged as a promising direction for drug discovery. However, existing methods require extensive training/fine-tuning with a large dataset, often unavailable in real-world generation tasks. In this work, we propose a new retrieval-based framework for controllable molecule generation. We use a small set of exemplar molecules, i.e., those that (partially) satisfy the design criteria, to steer the pre-trained generative model towards synthesizing molecules that satisfy the given design criteria. We design a retrieval mechanism that retrieves and fuses the exemplar molecules with the input molecule, which is trained by a new self-supervised objective that predicts the nearest neighbor of the input molecule. We also propose an iterative refinement process to dynamically update the generated molecules and retrieval database for better generalization. Our approach is agnostic to the choice of generative models and requires no task-specific fine-tuning. On various tasks ranging from simple design criteria to a challenging real-world scenario for designing lead compounds that bind to the SARS-CoV-2 main protease, we demonstrate our approach extrapolates well beyond the retrieval database, and achieves better performance and wider applicability than previous methods. Code is available at https://github.com/NVlabs/RetMol.

研究の動機と目的

  • ラベル付きの活性分子が限られたデータが乏しい環境における制御可能な分子生成の課題に対処すること。
  • 広範な微調整を要するか、現代のアーキテクチャと互換性のない固定潜在空間モデルに依存する既存手法の限界を克服すること。
  • 最小限のモデル適合で多様な分子設計タスクに一般化すること。
  • 下位の生成モデルの選択に依存しないフレームワークを構築し、現実世界の薬剤発見環境でも効率的に動作させること。

提案手法

  • 例示分子を用いて生成モデルをガイドするため、事前学習済み生成モデル(例:BARTベース)とリtrievalモジュールを統合する。
  • 構造的・性質的類似度に基づき、入力分子と例示分子をリtrievalし統合するメカニズムを設計する。
  • 入力分子の潜在空間における最近傍を予測する自己教師付き目的関数を用いてリtrievalモジュールを訓練する。
  • 生成分子とリtrievalデータベースを動的に更新する反復的精錬プロセスを実装し、一般化性能を向上させる。
  • ドッキング親和性などの満たしがたい制約を優先順位付けする属性緩和順序を用い、収束性と成功確率を向上させる。
  • グラフベースのアーキテクチャ(例:HierG2G)を含む多様な生成モデルと互換性を持つように、リtrieval機構と生成モデルを分離する。

実験結果

リサーチクエスチョン

  • RQ1タスク固有の微調整を伴わず、リtrievalベースのアプローチが強力な制御可能な分子生成性能を達成できるか?
  • RQ2限られた活性分子しか存在しない現実世界の薬剤設計タスクに、このフレームワークはどれほど一般化できるか?
  • RQ3属性緩和順序が、複数制約最適化におけるリtrieval成功度と収束性に与える影響は何か?
  • RQ4このフレームワークは、トランスフォーマーに基づくアーキテクチャを超える多様な生成モデルに効果的に適用可能か?
  • RQ5エンドツーエンドの微調整や潜在空間最適化と比較して、リtrievalベースの統合機構は、効率性と性能の面でどのように優れるか?

主な発見

  • RetMolは、ペナルティ付きlogPやQED最適化を含む、複数の制御可能な生成タスクで最先端の性能を達成し、微調整なしのベースライン手法を上回る。
  • SARS-CoV-2主要プロテアーゼ阻害剤の設計タスクにおいて、RetMolは結合親和性が向上した分子を効果的に生成し、現実世界への応用可能性を示した。
  • リtrievalモジュールによる計算オーバーヘッドはほとんどなく、平均して1分子あたり0.0006秒の追加時間(ベースモデルの0.00343秒対比で0.00402秒)にとどまる。
  • 入力分子とその10番目の最近傍との間の平均コサイン類似度は0.35であり、低順位でもリtrievalされた分子が構造的に関連性を保っていることが示された。
  • RetMolはHierG2Gを含む異なるベース生成モデルでも高い性能を維持しており、アーキテクチャを問わず互換性と一般化性能を確認した。
  • ドッキング親和性などの難しい制約を、類似度などの簡単な制約よりも先に緩和することで、QEDタスクにおける成功確率が11%向上(89.5%対78.5%)し、戦略の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。