Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Aqueous Solubility of Organic Molecules Using Deep Learning Models with Varied Molecular Representations

Gihan Panapitiya, Michaël J. A. Girard|arXiv (Cornell University)|May 26, 2021
Computational Drug Discovery Methods参考文献 52被引用数 5
ひとこと要約

本研究では、4つのニューラルネットワークアーキテクチャを用いて、分子記述子、SMILES、分子グラフ、3次元座標の多様な分子表現を用いて、有機分子の水溶性を予測するディープラーニングモデルを開発した。分子記述子に基づくモデルが最も高い精度を達成した一方、3次元データを用いないにもかかわらず、グラフニューラルネットワーク(GNN)は強力な性能を示した。一方、SchNetは限られたトレーニングデータと計算制約のため、性能が低かった。

ABSTRACT

Determining the aqueous solubility of molecules is a vital step in many pharmaceutical, environmental, and energy storage applications. Despite efforts made over decades, there are still challenges associated with developing a solubility prediction model with satisfactory accuracy for many of these applications. The goal of this study is to develop a general model capable of predicting the solubility of a broad range of organic molecules. Using the largest currently available solubility dataset, we implement deep learning-based models to predict solubility from molecular structure and explore several different molecular representations including molecular descriptors, simplified molecular-input line-entry system (SMILES) strings, molecular graphs, and three-dimensional (3D) atomic coordinates using four different neural network architectures - fully connected neural networks (FCNNs), recurrent neural networks (RNNs), graph neural networks (GNNs), and SchNet. We find that models using molecular descriptors achieve the best performance, with GNN models also achieving good performance. We perform extensive error analysis to understand the molecular properties that influence model performance, perform feature analysis to understand which information about molecular structure is most valuable for prediction, and perform a transfer learning and data size study to understand the impact of data availability on model performance.

研究の動機と目的

  • 広範な有機分子の範囲にわたって水溶性を予測できる汎用的なディープラーニングモデルの開発を目的とする。
  • 分子記述子、SMILES、分子グラフ、3次元座標の異なる分子表現が、水溶性予測精度に与える影響を評価することを目的とする。
  • 全結合ネットワーク、RNN、GNN、SchNetの4つのニューラルネットワークアーキテクチャの性能を評価することを目的とする。
  • モデルの予測誤差に影響を与える分子的性質や構造的特徴を同定することを目的とする。
  • データサイズとトランスファーラーニングの効果が、モデルの一般化性能および性能に与える影響を調査することを目的とする。

提案手法

  • 最大の利用可能な水溶性データセットを用いて、分子構造からlog水溶性を予測するディープラーニングモデルをトレーニングした。
  • 4つの分子表現(分子記述子、SMILES文字列、分子グラフ、3次元原子座標)を用いた。
  • 4つのニューラルネットワークアーキテクチャ(全結合ニューラルネットワーク(FCNN)、再帰ニューラルネットワーク(RNN)、グラフニューラルネットワーク(GNN)、SchNet)を適用した。
  • 超パrameterチューニングと、水溶性の階層に応じたストラティファイドデータ分割を実施し、トレーニングと評価のバランスを確保した。
  • 誤差解析を実施し、体系的な予測失敗要因を同定するとともに、特徴量の重要度分析により、予測に寄与する構造的特徴を評価した。
  • トランスファーラーニングとデータサイズアブレーションスタディを実施し、モデルのロバストネスとデータ効率を評価した。

実験結果

リサーチクエスチョン

  • RQ1多様な有機分子に対して、どの分子表現が最も高い水溶性予測精度を達成するか?
  • RQ2同じ入力表現を用いた場合、全結合ネットワーク(FCNN)、RNN、GNN、SchNetの各ディープラーニングアーキテクチャの性能はどのように比較されるか?
  • RQ33次元分子幾何学を組み込むことで、水溶性予測精度はどの程度向上するか?
  • RQ4どの分子的性質や構造的特徴が、水溶性モデルの予測誤差を高める要因となるか?
  • RQ5モデルの性能はトレーニングデータサイズにどのように依存するか?また、トランスファーラーニングは、データが少ない水溶性領域の性能向上に寄与するか?

主な発見

  • 分子記述子に基づくモデルが、他のすべての表現およびアーキテクチャを上回る予測精度を達成した。
  • 3次元構造情報を利用しないにもかかわらず、グラフニューラルネットワーク(GNN)が強力な性能を示した。これは、関連するトポロジカル特徴を効果的に捉えていることを示している。
  • 3次元幾何学を目的として設計されたSchNetは、顕著に性能が低く、限られたトレーニングデータと計算制約が主な要因と考えられる。
  • 複雑な分子、異性体、および置換基の位置がわずかに異なる分子では、モデルの誤差率が高くなった。
  • 外部データセットでの事前学習により、生の入力を利用するモデルの性能が向上した。これは、より大きな事前学習データを用いることでさらなる向上が期待できる可能性を示している。
  • 誤差パターンはモデル間で強く相関しており、類似した構造-性質関係を共有して学習していることが示された。また、トレーニングデータが多い水溶性範囲では誤差が小さくなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。