Skip to main content
QUICK REVIEW

[論文レビュー] MIMOSA: Multi-constraint Molecule Sampling for Molecule Optimization

Tianfan Fu, Cao Xiao|arXiv (Cornell University)|Oct 5, 2020
Computational Drug Discovery Methods参考文献 36被引用数 11
ひとこと要約

MIMOSAは、事前学習済みのグラフニューラルネットワーク(GNN)を用いて分子のトポロジーとサブストラクチャータイプを予測することで、重み付き制約を伴う追加・置換・削除操作を繰り返し行うことで分子を生成する、多制約分子最適化のための新規なサンプリングフレームワークである。DRD2とPLogPの特性を同時に最適化する際、最高のベースライン(GA)と比較して最大49.1%の相対的な成功率向上を達成した。

ABSTRACT

Molecule optimization is a fundamental task for accelerating drug discovery, with the goal of generating new valid molecules that maximize multiple drug properties while maintaining similarity to the input molecule. Existing generative models and reinforcement learning approaches made initial success, but still face difficulties in simultaneously optimizing multiple drug properties. To address such challenges, we propose the MultI-constraint MOlecule SAmpling (MIMOSA) approach, a sampling framework to use input molecule as an initial guess and sample molecules from the target distribution. MIMOSA first pretrains two property agnostic graph neural networks (GNNs) for molecule topology and substructure-type prediction, where a substructure can be either atom or single ring. For each iteration, MIMOSA uses the GNNs' prediction and employs three basic substructure operations (add, replace, delete) to generate new molecules and associated weights. The weights can encode multiple constraints including similarity and drug property constraints, upon which we select promising molecules for next iteration. MIMOSA enables flexible encoding of multiple property- and similarity-constraints and can efficiently generate new molecules that satisfy various property constraints and achieved up to 49.6% relative improvement over the best baseline in terms of success rate. The code repository (including readme file, data preprocessing and model construction, evaluation) is available https://github.com/futianfan/MIMOSA.

研究の動機と目的

  • 既存の手法が単一の特性最適化やペairedな訓練データに依存するため、複数の薬物特性を同時に最適化するという挑戦に直面する分子生成分野の課題に対処すること。
  • 訓練データにペアド分子データ(入力分子と最適化された分子)を必要としない柔軟で効率的なフレームワークを構築することにより、訓練データからのバイアスを低減すること。
  • マークフ・チェーン・モンテカルロ(MCMC)手法を用いて、構造的類似性や薬物特性といった複数の制約を符号化したターゲット分布からの有効かつ偏りのないサンプリングを可能にすること。
  • 与えられた入力分子と類似した構造を維持しながら、複数の薬理的および物理化学的制約を満たす分子を生成する際の成功率を向上させること。
  • サンプリングプロセスにおける収束性と一様性(エルゴディシティ)の理論的保証を提供し、化学空間の偏りのない探索を保証すること。

提案手法

  • 原子、環、および結合タイプを表すノードおよびエッジ特徴量を用いて、分子トポロジー予測用(mGNN)およびサブス トラクチャータイプ予測用(bGNN)の2つの性質に依存しないGNNを事前学習する。
  • GNNが生成する分子埋め込みを用いて、各反復におけるサブス トラクチャーレベルの操作(追加・置換・削除)を誘導する。
  • 式(1)に示すターゲット分布 p_X(Y) を定義し、類似性(Tanimoto)と特性制約(例:PLogP、QED、DRD2)を学習可能な重み η₀、η₁、η₂ を用いて統合する。
  • 新しい分子がサブス トラクチャーオペレーションに基づいて提案され、ターゲット分布の重みに比例する確率で受け入れられる、マークフ・チェーン・モンテカルロ(MCMC)サンプリング戦略を適用する。
  • サンプリングの安定化と収束を保証するため、バーニング・イン段階(T_burnin = 5)と最大反復回数(T_max = 10)を設定する。
  • 探索と制約満たしのバランスを取るために、MCMCプロセスで重み付きの受容基準を採用し、各反復で20個の分子を保持する。

実験結果

リサーチクエスチョン

  • RQ1サンプリングベースのフレームワークは、与えられた分子と類似性を保ちながら、PLogP、QED、DRD2などの複数の薬物特性を同時に最適化できるか?
  • RQ2トポロジーおよびサブス トラクチャープレトレーニング済みGNNは、ペアドデータを必要とせず、生成された分子の品質と妥当性を向上させられるか?
  • RQ3多制約重み付きのMCMCベースのサンプリング戦略は、収束性とターゲット分布からの偏りのないサンプリングを保証するか?
  • RQ4MIMOSAは、最先端のベースライン(例:GA、JTVAE、VJTNN、GCPN)と比較して、多特性最適化タスクにおける成功率で優れているか?
  • RQ5再トレーニングやペアドデータを必要とせず、類似性や複数の物理化学的特性といった多様な制約をフレームワークが柔軟に符号化できるか?

主な発見

  • MIMOSAはDRD2とPLogPを同時に最適化する際、43.7%の成功率を達成し、最高成績を示したベースライン(GA)と比較して49.1%の相対的向上を示した。
  • QED+PLogPおよびDRD+PLogPといった複数の特性最適化設定においても、MIMOSAは一貫してすべてのベースラインを上回る優れた性能を示した。
  • サブス トラクチャーやトポロジー予測のための事前学習済みGNNの使用により、ペアド分子データを必要とせず、サンプリング効率と分子妥当性が顕著に向上した。
  • 理論的分析により、MCMCサンプリングプロセスが一様性を満たし、ターゲット分布に収束することが確認され、化学空間の偏りのない探索が保証された。
  • きびしい類似性制約(例:Tanimoto類似度 ≥ 0.3)下でも高い成功率を達成しており、新規性と構造的正確性の効果的なバランスを示した。
  • アブレーションスタディにより、GNNの事前学習と多制約重み付け機構の両方が高性能を達成するために不可欠であり、両者の欠落により成功率が著しく低下することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。