Skip to main content
QUICK REVIEW

[論文レビュー] Learning Latent Space Energy-Based Prior Model for Molecule Generation

Bo Pang, Tian Han|arXiv (Cornell University)|Oct 19, 2020
Machine Learning in Materials Science参考文献 9被引用数 7
ひとこと要約

本稿では、文字単位のSMILES文字列を用いて、明示的な化学則の制約なしに有効かつ一意な分子生成を可能にする潜在空間エネルギーベース事前分布モデルを提案する。データ駆動型で表現力のある事前分布を潜在空間で学習することで、有効性、一意性、分子性質分布の一致において最先端の性能を達成し、複雑な化学則がデータから暗黙的に学習可能であることを示している。

ABSTRACT

Deep generative models have recently been applied to molecule design. If the molecules are encoded in linear SMILES strings, modeling becomes convenient. However, models relying on string representations tend to generate invalid samples and duplicates. Prior work addressed these issues by building models on chemically-valid fragments or explicitly enforcing chemical rules in the generation process. We argue that an expressive model is sufficient to implicitly and automatically learn the complicated chemical rules from the data, even if molecules are encoded in simple character-level SMILES strings. We propose to learn latent space energy-based prior model with SMILES representation for molecule modeling. Our experiments show that our method is able to generate molecules with validity and uniqueness competitive with state-of-the-art models. Interestingly, generated molecules have structural and chemical features whose distributions almost perfectly match those of the real molecules.

研究の動機と目的

  • 標準的な言語モデルベースのアプローチでは、しばしば無効または重複する出力が生じる単純な文字単位のSMILES表現を用いた、化学的に有効で一意な分子の生成という課題に対処すること。
  • 単純な等方的ガウス事前分布に依存する従来のVAEベースのモデルの限界を克服すること。これは、複雑な化学則の効果的な学習を妨げることがある。
  • 表現力のある潜在空間事前分布が、明示的な結合価数のチェックや断片ベースの表現なしに、データから化学則を暗黙的に学習できることを示すこと。
  • 有効性、一意性、分子性質分布の一致において、最先端のグラフベースおよび断片ベースのモデルと同等の性能を達成すること。
  • このモデルが、logP、QED、SASなどの構造的・化学的特徴を、これらの性質についての明示的教師信号なしに、実データ分布に密接に再現できるかどうかを示すこと。

提案手法

  • VAEにおける標準的な等方的ガウス事前分布に代わり、条件付き自己回帰的生成器(LSTMベース)と学習された潜在空間エネルギーベース事前分布を組み合わせたハイブリッド生成モデルを提案する。
  • 事前分布をギブス分布として定式化する:$ p_{\bar{\alpha}}(z) = \frac{1}{Z(\alpha)} \exp(f_{\alpha}(z)) p_0(z) $、ここで$ f_{\alpha}(z) $は、基本的なガウス分布に対するデータ駆動型補正を学習するニューラルネットワークである。
  • 再パラメータリゼーションテクニックと短時間ランダム・マルコフ連鎖モンテカルロ法(MCMC)を用いて、事後分布の期待値を近似する変分推論フレームワークでモデルを訓練する。
  • 二段階の学習プロセスを採用する:まずMCMCを用いて事後分布$ p_{\theta}(z|x) $を近似し、その後、近似事後分布に基づく勾配推定を用いてモデルパラメータ$ \alpha $と$ \beta $を更新する。
  • 低次元の潜在空間を活用してMCMCサンプリングを効率的に行い、トレーニング中の混合と収束を改善する。
  • 生成器ネットワークは、潜在コードを条件として一括符号号化されたSMILESトークンを自己回帰的に予測する単層LSTMであり、効率的かつ効果的な分子生成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1文字単位のSMILES文字列のみを用いて、明示的な化学則の制約なしに、潜在空間エネルギーベース事前分布モデルが化学的に有効で一意な分子を生成できるか?
  • RQ2潜在空間における複雑でデータ駆動型の事前分布を学習することで、結合価数や芳香族性などの複雑な化学則が、生のSMILESデータから暗黙的に捉えられるか?
  • RQ3特にこれらの性質についての明示的教師信号なしに、生成された分子が実データの分子性質分布(例:logP、QED、SAS)とどの程度一致するか?
  • RQ4このアプローチは、有効性、一意性、性質一致において、最先端のグラフベースおよび断片ベースのモデルと同等の性能を達成できるか?
  • RQ5このモデルの表現力は、等方的ガウス事前分布を用いた標準的なVAEに比べて、現実的で多様な分子を生成する面でどの程度優れているか?

主な発見

  • 提案モデルは、ZINCデータセットから10,000個の分子を生成する際、95.5%の有効性と100%の一意性を達成し、標準的なLMベースのモデルを上回り、最良の断片ベースおよびグラフベースのモデルと同等の性能を示した。
  • このモデルは、これらの性質についての明示的教師信号なしに、訓練データ内の実分子と同様の分子性質分布(logP、QED、SAS)を生成した。
  • FragmentVAEと比較して、分子性質分布の一致において優れた性能を示し、より良い一般化能力と表現力があることを示唆している。
  • 100%の新規性を達成しており、生成されたすべての分子が訓練データに存在しないことを示しており、強力な一般化能力と多様性を示している。
  • 結果から、複雑な化学則が柔軟な潜在事前分布を介してデータから暗黙的に学習可能であり、グラフベースのモデルにおける結合価数のチェックなどの明示的制約への依存を減らせることが示唆された。
  • モデルの性能は、表現力のある潜在事前分布が、文字単位のSMILES表現の単純さを補い、アーキテクチャの複雑さなしに高品質な分子生成を可能にできることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。