Skip to main content
QUICK REVIEW

[論文レビュー] Improved decision making with similarity based machine learning: Applications in chemistry

Dominik Lemm, Guido Falk von Rudorff|arXiv (Cornell University)|May 11, 2022
Machine Learning in Materials Science参考文献 92被引用数 5
ひとこと要約

本稿では、与えられたクエリに最も類似する訓練点のみを用いてクエリ固有のモデルを訓練する、データ効率的なフレームワークである類似性ベース機械学習(SML)を提案する。大規模で多様なデータセットに依存するのではなく、局所的な類似性に注目することで、SMLは極めて少ないデータポイントで競争力ある予測性能を達成する。これは、量子化学および有機合成タスクで実証された。また、特徴空間の内在次元とモデル精度の理論的関係を確立している。

ABSTRACT

Despite the fundamental progress in autonomous molecular and materials discovery, data scarcity throughout chemical compound space still severely hampers the use of modern ready-made machine learning models as they rely heavily on the paradigm, 'the bigger the data the better'. Presenting similarity based machine learning (SML), we show an approach to select data and train a model on-the-fly for specific queries, enabling decision making in data scarce scenarios in chemistry. By solely relying on query and training data proximity to choose training points, only a fraction of data is necessary to converge to competitive performance. After introducing SML for the harmonic oscillator and the Rosenbrock function, we describe applications to scarce data scenarios in chemistry which include quantum mechanics based molecular design and organic synthesis planning. Finally, we derive a relationship between the intrinsic dimensionality and volume of feature space, governing the overall model accuracy.

研究の動機と目的

  • 高価なデータポイントが数10〜数100個しか入手できない分子および材料科学分野におけるデータ不足問題に対処すること。
  • 高い性能を発揮するためには大規模で多様なデータセットに依存する標準的な機械学習モデルの限界を克服すること。
  • 各クエリに対して、類似度が最も高いデータポイントのみを選択することで、モデルの学習をクエリに特化させ、データ効率を向上させること。
  • SMLの有効性を、量子性質予測や有機合成計画といった実世界の化学的応用において実証すること。
  • 低データ環境下における特徴空間の内在次元とモデル精度の理論的関係を確立すること。

提案手法

  • SMLは、特徴空間におけるクエリと訓練点の間の類似度(距離)に基づいて訓練データを選択し、FCHL19やSOAP表現におけるユークリッド距離などの距離尺度を用いる。
  • 各クエリに対して、$\overline{N}_q$ 個の最近傍点のみを用いて、即座にカーネルリッジ回帰モデルを訓練することで、クエリ固有の適合を実現する。
  • 各クエリに対して再訓練を回避するため、最大の訓練セット上で交差検証により最適化された固定されたハイパーパrameter($\sigma$, $\lambda$)を用いる。
  • FCHL19 や SOAP といった特徴表現を用いて、分子構造を高次元ベクトルに符号化し、類似度計算に用いる。
  • SMLはランダム機械学習(RML)およびk-NNベースラインと比較され、複数のクエリにわたる平均化された学習曲線を用いて性能を評価する。
  • 理論的分析により、モデル精度が特徴空間の内在次元と体積に依存することを示し、内在次元が低いほど低データ環境下での一般化性能が向上することを示している。

実験結果

リサーチクエスチョン

  • RQ1クエリに最も類似するデータポイントのみを用いて学習することで、データが乏しい化学的応用においても高い予測精度を達成できるか?
  • RQ2SMLの性能は、ランダムなデータ選択(RML)およびk-NNベースラインと比較して、データ効率性および予測精度の面で優れているか?
  • RQ3低データ環境下におけるSMLモデルの精度と特徴空間の内在次元の関係は何か?
  • RQ4SMLは、量子性質予測や有機合成計画といった実世界の化学的問題に、どの程度適用可能か?
  • RQ5データが乏しい状況下で、局所的な類似性に基づくクエリ固有のモデル学習が、大規模で多様なデータセットに依存するグローバルモデルを上回る性能を発揮するか?

主な発見

  • SMLは、全訓練データのわずか一部でさえも、競争力ある予測精度を達成しており、特にデータが乏しい状況下でランダムデータ選択(RML)を顕著に上回っている。
  • QM9データセットでは、SMLは訓練データの10%のみで高い精度に到達するが、RMLは性能を同等に達成するためにははるかに多くのデータを必要とする。
  • Enamine REALデータベースにおける溶媒化エネルギー予測において、SMLは最小限のラベル付きデータで低い平均絶対誤差(MAE)を達成し、大規模な合成計画分野における実用的価値を示している。
  • 理論的分析により、モデル精度は特徴空間の内在次元と体積に支配され、内在次元が低いほど低データ環境下での一般化性能が向上することが示された。
  • SMLの学習曲線は、RMLおよびk-NNベースラインと比較して、より速い収束と低いデータ要件を示しており、そのデータ効率性を確認している。
  • 本手法は、量子力学的性質予測や構造異性体の列挙といった多様な化学的タスクにおいても頑健であり、汎用性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。