Skip to main content
QUICK REVIEW

[論文レビュー] Constant Size Molecular Descriptors For Use With Machine Learning

Christopher R. Collins, Geoffrey J. Gordon|arXiv (Cornell University)|Jan 23, 2017
Computational Drug Discovery Methods参考文献 2被引用数 7
ひとこと要約

本稿では、分子サイズに依存しないが局所的な原子環境および原子間距離を捉える定数サイズの分子記述子を導入する。結合性のカウントと符号化された距離特徴を組み合わせることで、特に熱力学的および電子的性質の予測において最先端の性能を達成し、小分子で学習したモデルが大規模な分子へも効果的に一般化可能であることを示している。

ABSTRACT

A set of molecular descriptors whose length is independent of molecular size is developed for machine learning models that target thermodynamic and electronic properties of molecules. These features are evaluated by monitoring performance of kernel ridge regression models on well-studied data sets of small organic molecules. The features include connectivity counts, which require only the bonding pattern of the molecule, and encoded distances, which summarize distances between both bonded and non-bonded atoms and so require the full molecular geometry. In addition to having constant size, these features summarize information regarding the local environment of atoms and bonds, such that models can take advantage of similarities resulting from the presence of similar chemical fragments across molecules. Combining these two types of features leads to models whose performance is comparable to or better than the current state of the art. The features introduced here have the advantage of leading to models that may be trained on smaller molecules and then used successfully on larger molecules.

研究の動機と目的

  • 分子サイズに比例して大きくなりえない記述子の開発により、効率的かつ一般化可能な機械学習モデルの実現を図る。
  • コウルン行列やBag of Bonds(BoB)といった従来手法の限界(分子サイズに比例して二次的に増大する)を解決する。
  • 局所的な化学的環境と原子間距離を符号化することで、小分子から大分子へのモデル一般化を向上させる。
  • SMILESや2次元の結合性情報から得られる特徴を活用しつつ、3次元的な幾何的情報を組み込むことで、予測性能を強化する。
  • 定数サイズの特徴が、QM9などのベンチマークデータセットにおいて、最先端の手法と同等または優れた性能を達成できることを示す。

提案手法

  • 原子および結合の種類を要約するため、ランク1およびランク2の結合性カウントを用いる。これにより、局所的な化学的断片を捉える。
  • すべての原子間(共有結合だけでなく非共有結合対を含む)の距離の滑らかに平均化されたヒストグラムを表す符号化された距離特徴を導入。固定サイズのベクトルとして表現される。
  • 結合性カウントと符号化された距離特徴を統合し、分子サイズに依存しない固定サイズの特徴ベクトルを構築する。
  • 標準的なカーネルを用いたカーネルリッジ回帰(KRR)を適用し、これらの特徴を用いて分子性質を予測する。
  • 距離符号化には固定数のビンを用い、特徴ベクトルの長さが元素および結合の種類の多様性にのみ依存し、分子サイズに依存しないようにする。
  • 小分子のサブセットでモデルを学習し、その性能を大規模な分子に対して評価することで、一般化能力をテストする。

実験結果

リサーチクエスチョン

  • RQ1分子サイズが異なる分子に対し、予測性能を維持できる定数サイズの分子記述子を設計可能か?
  • RQ2結合性カウントと符号化された距離特徴を組み合わせることで、小分子から大分子へのモデル一般化はどの程度向上するか?
  • RQ3符号化された距離によって3次元的な幾何的情報を組み込むことで、2次元の結合性情報のみを用いる場合に比べ、モデル性能はどの程度向上するか?
  • RQ4定数サイズの特徴を用いる場合、小分子で学習したモデルが大規模な分子の性質を効果的に予測できるか?
  • RQ5標準データセット上で、コウルン行列やBoB特徴といった最先端の手法と比較して、これらの記述子の性能はどの程度か?

主な発見

  • 提案された特徴ベクトル $\bm{12^{NP}3^{B}4^{B}}$ は、解離エネルギーについて1.6 kcal/molの平均絶対誤差(MAE)を達成し、最先端のモデルと同等または優れた性能を示している。
  • 熱力学的性質($U_0$, $U$, $H$, $G$)についても、MAEが2.1 kcal/mol未満であり、優れた予測性能を示している。
  • 比熱はMAEが0.10 cal/(mol K)であり、これはノイズモデルの誤差の2%に相当し、非常に高い精度を示している。
  • HOMOおよびLUMOエネルギー、およびHOMO-LUMOギャップは、MAEが0.2 eV未満であり、電子的性質の予測において良好な性能を示している。
  • 静電率($\alpha$)は、ノイズモデルの誤差の6.5%のMAEで予測されており、これは断片加法的性質であることに起因する強力な性能を示している。
  • 双極子モーメント($\mu$)は相対的に性能が低く、ノイズモデルの誤差の50%の削減にとどまっている。これは、分子全体の幾何的構造に強く依存する性質であるためと考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。