Skip to main content
QUICK REVIEW

[论文解读] Improved decision making with similarity based machine learning: Applications in chemistry

Dominik Lemm, Guido Falk von Rudorff|arXiv (Cornell University)|May 11, 2022
Machine Learning in Materials Science参考文献 92被引用 5
一句话总结

本文提出了一种基于相似性的机器学习(SML)方法,这是一种数据高效的框架,通过仅使用与给定查询最相似的训练样本,为每个查询训练特定的模型。与依赖大规模多样化数据集的标准机器学习方法不同,SML通过聚焦于局部相似性,在显著减少数据量的前提下实现了具有竞争力的预测性能——在量子化学和有机合成任务中得到验证,同时建立了特征空间内在维度与模型准确率之间的理论联系。

ABSTRACT

Despite the fundamental progress in autonomous molecular and materials discovery, data scarcity throughout chemical compound space still severely hampers the use of modern ready-made machine learning models as they rely heavily on the paradigm, 'the bigger the data the better'. Presenting similarity based machine learning (SML), we show an approach to select data and train a model on-the-fly for specific queries, enabling decision making in data scarce scenarios in chemistry. By solely relying on query and training data proximity to choose training points, only a fraction of data is necessary to converge to competitive performance. After introducing SML for the harmonic oscillator and the Rosenbrock function, we describe applications to scarce data scenarios in chemistry which include quantum mechanics based molecular design and organic synthesis planning. Finally, we derive a relationship between the intrinsic dimensionality and volume of feature space, governing the overall model accuracy.

研究动机与目标

  • 解决分子与材料科学中的数据稀缺问题,即仅有数百个或几十个高成本的数据点可用。
  • 克服标准机器学习模型依赖大规模多样化数据集以实现高性能的局限性。
  • 开发一种方法,通过仅选择与查询最相似的数据点来为每个查询定制模型训练,从而提升数据效率。
  • 在真实化学应用中(如量子性质预测和有机合成规划)证明SML的有效性。
  • 建立特征空间内在维度与低数据环境下模型准确率之间的理论关系。

提出的方法

  • SML基于特征空间中查询点与训练点之间的接近程度(相似性)选择训练数据,使用欧氏距离等距离度量(如FCHL19或SOAP表示)。
  • 对于每个查询,仅使用$\overline{N}_q$个最近邻点在线训练一个核岭回归模型,确保查询特定的自适应能力。
  • 通过在最大训练集上进行交叉验证,优化固定超参数($\sigma$, $\lambda$),避免为每个查询重新训练。
  • 使用FCHL19和SOAP等特征表示将分子结构编码为高维向量,以计算相似性。
  • 将SML与随机机器学习(RML)和k-NN基线方法进行比较,通过在多个查询上平均的学习曲线评估性能。
  • 理论分析表明,模型准确率受特征空间的内在维度和体积影响,内在维度越低,在低数据环境下泛化性能越好。

实验结果

研究问题

  • RQ1通过仅在与查询最相似的数据点上进行训练,机器学习模型是否能在数据稀缺的化学应用中实现高预测准确率?
  • RQ2在数据效率和预测准确率方面,SML相较于随机数据选择(RML)和k-NN基线方法表现如何?
  • RQ3在低数据环境下,特征空间的内在维度与SML模型准确率之间存在何种关系?
  • RQ4SML在真实化学问题(如量子性质预测和有机合成规划)中的适用程度如何?
  • RQ5当数据稀缺时,基于局部相似性的查询特定模型训练是否优于在大规模多样化数据集上训练的全局模型?

主要发现

  • SML仅使用总训练数据的一小部分即可实现具有竞争力的预测准确率,在数据稀缺场景下显著优于随机数据选择(RML)。
  • 在QM9数据集上,SML仅使用10%的训练数据即可达到高准确率,而RML需要远多于此的数据才能匹配性能。
  • 在Enamine REAL数据库中对溶剂化自由能的预测中,SML仅用极少的标注数据即实现了低的平均绝对误差(MAE),展示了其在大规模合成规划中的实际应用价值。
  • 理论分析表明,模型准确率由特征空间的内在维度和体积决定,内在维度越低,在低数据环境下性能越好。
  • SML的学习曲线表现出更快的收敛速度和更低的数据需求,证实了其数据效率。
  • 该方法在多种化学任务中表现稳健,包括量子力学性质预测和结构异构体枚举,验证了其泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。