Skip to main content
QUICK REVIEW

[論文レビュー] Learning a Continuous Representation of 3D Molecular Structures with Deep Generative Models

Matthew Ragoza, Tomohide Masuda|arXiv (Cornell University)|Oct 17, 2020
Machine Learning in Materials Science参考文献 34被引用数 11
ひとこと要約

本論文は、原子密度グリッドと新規のフィッティングアルゴリズムを用いて、連続的で3次元的な分子構造を学習する最初のディープ生成モデルを提示する。このモデルは生成された分子の有効性を90%以上達成し、潜在空間の補間と条件付き生成を用いて多様でドラッグライクなコンformationの探索を可能にする。

ABSTRACT

Machine learning in drug discovery has been focused on virtual screening of molecular libraries using discriminative models. Generative models are an entirely different approach that learn to represent and optimize molecules in a continuous latent space. These methods have been increasingly successful at generating two dimensional molecules as SMILES strings and molecular graphs. In this work, we describe deep generative models of three dimensional molecular structures using atomic density grids and a novel fitting algorithm for converting continuous grids to discrete molecular structures. Our models jointly represent drug-like molecules and their conformations in a latent space that can be explored through interpolation. We are also able to sample diverse sets of molecules based on a given input compound and increase the probability of creating valid, drug-like molecules.

研究の動機と目的

  • 3次元分子構造の連続的かつ低次元の潜在表現を学習するディープ生成モデルの開発。これにより、既存のライブラリをはるかに超える化学空間の探索が可能になる。
  • 2次元生成モデル(例:SMILES、分子グラフ)の制限を克服するため、3次元空間的情報とコンformationの多様性を保持する。
  • 連続的な原子密度グリッドから、結合と幾何学的整合性を持つ正確な離散的3次元分子構造に変換する、新規の最適化アルゴリズムの設計。
  • 化学的に有効でドラッグライクな分子を生成する能力の評価。具体的には、QEDスコアの向上や合成可能性の低減といった、改善された性質を実現する。
  • タンパク質の結合ポケットをターゲットとして条件付き生成を可能にし、構造条件付き3次元ドラッグ設計の道筋を築く。

提案手法

  • 3次元分子構造を原子密度グリッドとして表現することで、効率的な畳み込み処理と置換不変学習を可能にする。
  • 変分オートエンコーダー(VAEs)およびオートエンコーダー(AEs)を用いて、分子密度を連続的潜在空間に符号化・復号化する。
  • 連続的密度グリッドから離散的原子座標および結合種別へのマッピングを可能にする新規の原子フィッティングアルゴリズムを開発。幾何学的および価数の整合性を保証する。
  • 局所的な密度パターンと原子タイプに基づいて共有結合を同定・追加する結合追加アルゴリズムを適用。構造の忠実度を向上させる。
  • L2再構成損失と正則化(例:VAEにおけるKLD)を組み合わせたハイブリッド損失関数を用いることで、一般化性能と多様性を向上させる。
  • 化学的に情報のある原子タイプ(例:混成状態、形式的酸化数)を統合し、結合予測と分子再構成の精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1原子密度グリッドを用いたディープ生成モデルは、3次元分子構造の連続的かつ分離可能な潜在表現を学習できるか?
  • RQ2新規のフィッティングアルゴリズムは、結合と幾何学的整合性を持つ化学的に有効な3次元分子構造に、連続的潜在表現を信頼性高く変換できるか?
  • RQ3入力と比較して、本モデルは多様でドラッグライクな分子をどれほど効果的に生成できるか(例:QED、合成可能性)?
  • RQ4本モデルの性能は、トレーニング分布とは異なる分子を生成する際、どのように低下するか。再構成失敗の要因は何か?
  • RQ5本モデルは、タンパク質結合ポケットを条件として分子を生成する条件付き生成に拡張可能か?

主な発見

  • 本モデルは、生成された3次元分子の有効性が90%を超えることを示し、3次元分子構造に対するディープ生成モデリングの実現可能性を示した。
  • VAEの事後分布サンプルは、入力分子よりも高い最大QEDスコアを達成し、よりドラッグライクな化合物の生成に成功した。
  • 入力分子は低RMSD(0.1 Å未満)で再構成され、原子種別の回復率は98%であったが、分布外の分子では再構成品質が著しく低下した。
  • VAEの事後分布は、入力の類似度に関係なく安定した合成可能性スコアを生成し、新規で多様な構造の生成におけるロバスト性を示した。
  • 標準的なAEは、分布内分子ではほぼ完全な再構成を達成したが、多様性や類似性の低い入力では失敗した。これは、生成モデルにおける一般化性能の向上が求められることを示唆している。
  • 結合追加アルゴリズムは、実際の分子と0.82のTanimoto類似度を達成したが、現在の原子タイプ定義の制限により、さらなる改善の余地があると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。