Skip to main content
QUICK REVIEW

[论文解读] Constant Size Molecular Descriptors For Use With Machine Learning

Christopher R. Collins, Geoffrey J. Gordon|arXiv (Cornell University)|Jan 23, 2017
Computational Drug Discovery Methods参考文献 2被引用 7
一句话总结

本文提出了一种常量大小的分子描述符,用于机器学习,其大小不随分子尺寸变化,但能捕捉局部原子环境和原子间距离。通过结合连接性计数和编码的距离特征,该方法在预测分子性质方面达到最先进水平,尤其在热力学和电子性质方面表现优异,使在小分子上训练的模型能够有效泛化到更大分子。

ABSTRACT

A set of molecular descriptors whose length is independent of molecular size is developed for machine learning models that target thermodynamic and electronic properties of molecules. These features are evaluated by monitoring performance of kernel ridge regression models on well-studied data sets of small organic molecules. The features include connectivity counts, which require only the bonding pattern of the molecule, and encoded distances, which summarize distances between both bonded and non-bonded atoms and so require the full molecular geometry. In addition to having constant size, these features summarize information regarding the local environment of atoms and bonds, such that models can take advantage of similarities resulting from the presence of similar chemical fragments across molecules. Combining these two types of features leads to models whose performance is comparable to or better than the current state of the art. The features introduced here have the advantage of leading to models that may be trained on smaller molecules and then used successfully on larger molecules.

研究动机与目标

  • 设计一种大小不随分子尺寸变化的分子描述符,以实现高效且可泛化的机器学习模型。
  • 解决现有方法(如库仑矩阵和键袋,BoB)的局限性,这些方法的复杂度随分子尺寸呈二次方增长。
  • 通过编码局部化学环境和原子间距离,提升模型从小分子到大分子的泛化能力。
  • 在使用SMILES或2D连接性信息的基础上,整合3D几何信息,以增强预测能力。
  • 证明常量大小的特征可实现与最先进方法(如QM9基准数据集上的库仑矩阵或BoB特征)相当或更优的性能。

提出的方法

  • 使用秩-1和秩-2连接性计数来总结原子和键的类型,捕捉局部化学片段。
  • 引入编码的距离特征,通过固定大小的向量表示所有原子(包括非键合对)之间距离的平滑直方图。
  • 将连接性计数与编码的距离特征合并为一个大小恒定的特征向量,其大小与分子尺寸无关。
  • 使用这些特征进行核岭回归(KRR),并应用标准核函数预测分子性质。
  • 对距离编码使用固定数量的桶(bins),确保特征向量长度仅取决于元素和键类型的多样性,而不受分子尺寸影响。
  • 在小分子子集上训练模型,并在更大分子上评估其泛化能力。

实验结果

研究问题

  • RQ1能否设计出常量大小的分子描述符,使其在不同尺寸的分子上均保持预测性能?
  • RQ2当连接性计数与编码的距离特征结合时,对模型从小分子到大分子的泛化能力提升程度如何?
  • RQ3通过编码距离引入3D几何信息后,与仅使用2D连接性特征相比,模型性能提升程度如何?
  • RQ4当使用常量大小描述符时,是否能实现从小分子训练的模型成功预测大分子的性质?
  • RQ5在标准数据集上,这些描述符与最先进方法(如库仑矩阵或BoB特征)相比,性能如何?

主要发现

  • 所提出的特征向量 $\bm{12^{NP}3^{B}4^{B}}$ 在原子化能预测中达到1.6 kcal/mol的平均绝对误差(MAE),与最先进模型相当或更优。
  • 对于热力学性质(如 $U_0$、$U$、$H$ 和 $G$),MAE低于2.1 kcal/mol,表明预测性能强劲。
  • 对熵变的预测MAE为0.10 cal/(mol K),仅为零模型误差的2%,显示极高精度。
  • 最高占据分子轨道(HOMO)和最低未占分子轨道(LUMO)能级及HOMO-LUMO能隙的预测MAE均低于0.2 eV,表明电子性质预测性能良好。
  • 极化率($\alpha$)的预测MAE仅为零模型误差的6.5%,反映出优异性能,这得益于其片段加和特性。
  • 偶极矩($\mu$)表现相对较差,MAE仅比零模型降低50%,可能因其对全局分子几何构型高度敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。