[论文解读] Crystal Structure Representations for Machine Learning Models of Formation Energies
本文提出并评估了三种晶体结构表示方法——Ewald求和矩阵、扩展库仑矩阵和正弦矩阵——用于机器学习模型预测固体的生成能。基于Materials Project数据集中的3,938个结构,采用核岭回归方法,正弦矩阵表示法在测试中达到最低的泛化误差0.37 eV/原子,优于Ewald方法(0.49 eV/原子)和扩展库仑方法(0.64 eV/原子),且计算效率最高。
We introduce and evaluate a set of feature vector representations of crystal structures for machine learning (ML) models of formation energies of solids. ML models of atomization energies of organic molecules have been successful using a Coulomb matrix representation of the molecule. We consider three ways to generalize such representations to periodic systems: (i) a matrix where each element is related to the Ewald sum of the electrostatic interaction between two different atoms in the unit cell repeated over the lattice; (ii) an extended Coulomb-like matrix that takes into account a number of neighboring unit cells; and (iii) an Ansatz that mimics the periodicity and the basic features of the elements in the Ewald sum matrix by using a sine function of the crystal coordinates of the atoms. The representations are compared for a Laplacian kernel with Manhattan norm, trained to reproduce formation energies using a data set of 3938 crystal structures obtained from the Materials Project. For training sets consisting of 3000 crystals, the generalization error in predicting formation energies of new structures corresponds to (i) 0.49, (ii) 0.64, and (iii) 0.37 eV/atom for the respective representations.
研究动机与目标
- 将分子机器学习中成功的表示方法(如库仑矩阵)推广至周期性晶体体系。
- 评估三种不同的晶体结构表示方法在机器学习预测生成能中的性能表现。
- 识别在固体生成能建模中最具效率和准确性的表示方法。
- 评估训练集大小和数据多样性对模型泛化误差的影响。
- 探索在周期性体系中实现接近第一性原理精度的生成能预测的可行性。
提出的方法
- Ewald求和矩阵表示法使用Ewald求和技术计算原胞内原子之间的静电相互作用,同时考虑周期性边界条件。
- 扩展库仑矩阵表示法通过引入邻近原胞的相互作用,扩展了库仑矩阵的概念,以捕捉长程周期效应。
- 正弦矩阵表示法使用原子坐标的正弦函数近似Ewald求和的周期性特征,从而在保留关键结构特性的同时降低计算成本。
- 采用拉普拉斯核与曼哈顿范数的核岭回归方法,基于Materials Project中的生成能数据训练模型。
- 应用主成分分析(PCA)以可视化特征表示的结构,评估其聚类性和可分性。
- 通过在不同大小的训练集上进行交叉验证来评估泛化误差,误差单位为eV/原子。
实验结果
研究问题
- RQ1能否将分子体系中成功应用的库仑矩阵表示法有效推广至周期性晶体体系,用于生成能预测?
- RQ2在预测准确性和计算成本方面,Ewald求和矩阵、扩展库仑矩阵和正弦矩阵这三种晶体结构表示方法有何差异?
- RQ3随着训练集规模增大,泛化误差是否减小?这对模型可扩展性有何启示?
- RQ4尽管方法相似,为何固体体系的机器学习模型性能显著低于分子体系?
- RQ5更紧凑、化学限制更严格的子数据集是否能提升模型准确性,并减少对大规模训练集的依赖?
主要发现
- 在3,000个结构的训练集上,正弦矩阵表示法实现了最低的泛化误差0.37 eV/原子,优于Ewald求和矩阵(0.49 eV/原子)和扩展库仑矩阵(0.64 eV/原子)。
- 所有三种表示方法均显示出随着训练集规模增大,泛化误差系统性下降,表明在更大数据集下仍有进一步提升的潜力。
- 正弦矩阵表示法不仅最准确,而且计算效率最高,是大规模应用中最实用的选择。
- 主成分分析显示不同的聚类模式:Ewald求和矩阵表现出强聚类和异常值,而正弦矩阵与扩展库仑矩阵在结构上更为相似。
- 分子与固体体系之间性能差距的原因在于Materials Project数据集的化学和结构多样性远高于QM7分子数据集。
- 结果表明,若采用更大或更受限的训练数据,固体生成能的机器学习模型有望实现接近第一性原理精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。