Skip to main content
QUICK REVIEW

[论文解读] SPICE, A Dataset of Drug-like Molecules and Peptides for Training Machine Learning Potentials

Peter Eastman, Pavan Kumar Behara|arXiv (Cornell University)|Sep 21, 2022
Machine Learning in Materials Science被引用 13
一句话总结

SPICE 是一个大规模的量子化学数据集,包含超过110万个类药物分子、二肽和溶剂化氨基酸的构象,计算级别为 ωB97M-D3(BJ)/def2-TZVPPD。该数据集可支持训练出在广泛化学空间中实现化学精度的机器学习势能模型,涵盖共价和非共价相互作用,同时提供能量、力、多极矩和键级等属性,适用于可转移、高保真的模拟。

ABSTRACT

Machine learning potentials are an important tool for molecular simulation, but their development is held back by a shortage of high quality datasets to train them on. We describe the SPICE dataset, a new quantum chemistry dataset for training potentials relevant to simulating drug-like small molecules interacting with proteins. It contains over 1.1 million conformations for a diverse set of small molecules, dimers, dipeptides, and solvated amino acids. It includes 15 elements, charged and uncharged molecules, and a wide range of covalent and non-covalent interactions. It provides both forces and energies calculated at the ωB97M-D3(BJ)/def2-TZVPPD level of theory, along with other useful quantities such as multipole moments and bond orders. We train a set of machine learning potentials on it and demonstrate that they can achieve chemical accuracy across a broad region of chemical space. It can serve as a valuable resource for the creation of transferable, ready to use potential functions for use in molecular simulations.

研究动机与目标

  • 解决用于训练生物分子模拟中机器学习势能的高质量、多样化数据集稀缺的问题。
  • 提供一个全面的数据集,涵盖类药物小分子、二聚体、二肽和溶剂化氨基酸,涵盖多样的电子和立体环境。
  • 确保数据集支持可转移的机器学习势能模型的训练,适用于蛋白质-配体相互作用。
  • 包含高精度的量子化学数据,包括能量、力、多极矩和键级,以支持模型的稳健训练。
  • 推动开发可在广阔化学空间中实现化学精度的机器学习势能模型。

提出的方法

  • 通过系统性和随机采样,在类药物小分子、二肽和溶剂化氨基酸中生成超过110万种构象。
  • 在 ωB97M-D3(BJ)/def2-TZVPPD 理论水平上计算电子结构性质,包括总能量和解析力。
  • 额外包含多极矩和键级等属性,以增强模型对电子和成键特性的学习能力。
  • 使用包含15种元素的多样化集合,包括带电和不带电物种,以确保广泛的化学覆盖范围。
  • 使用标准架构在数据集上训练多种机器学习势能模型,以评估其可转移性和准确性。
  • 在包括共价和非共价相互作用在内的多样化化学环境中验证模型性能。

实验结果

研究问题

  • RQ1一个大规模、多样化的类药物分子和肽的数据集是否能够支持训练出实现化学精度的机器学习势能模型?
  • RQ2在SPICE上训练的机器学习势能模型在多大程度上能泛化到不同类型的分子相互作用,包括非共价和带电物种?
  • RQ3包含多极矩和键级等辅助属性在多大程度上提升了训练模型的可转移性和准确性?
  • RQ4SPICE数据集是否能够支持开发即用型、可转移的机器学习势能模型用于生物分子模拟?
  • RQ5SPICE训练的模型在捕捉各种化学环境中共价和非共价相互作用方面的性能如何?

主要发现

  • SPICE数据集包含超过110万种类药物分子、二聚体、二肽和溶剂化氨基酸的构象,覆盖了广泛的化学空间。
  • 量子化学计算在 ωB97M-D3(BJ)/def2-TZVPPD 水平上完成,提供了高精度的能量和解析力。
  • 数据集包含15种元素、带电和不带电物种,以及多样的共价和非共价相互作用。
  • 提供了多极矩和键级等补充属性,以增强模型对电子结构的学习能力。
  • 在SPICE上训练的机器学习势能模型在广泛分子构型和相互作用类型中实现了化学精度。
  • 该数据集支持开发可转移、即用型的机器学习势能模型,适用于涉及蛋白质和配体的分子模拟。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。