Skip to main content
QUICK REVIEW

[论文解读] Systematic Atomic Structure Datasets for Machine Learning Potentials: Application to Defects in Magnesium

Marvin Poul, Liam Huber|arXiv (Cornell University)|Jul 8, 2022
Machine Learning in Materials Science被引用 5
一句话总结

本文提出一种系统性、基于对称性的方法,用于为机器学习原子间势(MLIPs)生成无偏见的训练数据集,重点针对镁元素。通过采样所有可能的空间群及其形变,作者构建了可转移的势函数,能够准确描述hcp和bcc相以及缺陷结构——且训练过程中未包含缺陷结构,也未使用主动学习——在多种原子环境下的预测精度极高。

ABSTRACT

We present a physically motivated strategy for the construction of training sets for transferable machine learning interatomic potentials. It is based on a systematic exploration of all possible space groups in random crystal structures, together with deformations of cell shape, size, and atomic positions. The resulting potentials turn out to be unbiased and generically applicable to studies of bulk defects without including any defect structures in the training set or employing any additional Active Learning. Using this approach we construct transferable potentials for pure Magnesium that reproduce the properties of hexagonal closed packed (hcp) and body centered cubic (bcc) polymorphs very well. In the process we investigate how different types of training structures impact the properties and the predictive power of the resulting potential.

研究动机与目标

  • 开发一种基于物理动机、无偏见的机器学习原子间势训练集,避免依赖缺陷特异性或低能量结构。
  • 研究系统性采样晶体对称性对MLIPs在体相缺陷上可转移性和准确性的影响。
  • 证明即使不使用主动学习或在训练集中显式包含缺陷数据,也能实现高度可转移性。
  • 评估截断半径和基组级别在确保鲁棒性和准确性方面的作用,特别是针对表面和堆垛层错。
  • 建立一种可推广的、自动化的框架,用于构建适用于其他材料的可转移MLIPs。

提出的方法

  • 通过系统探索镁的所有可能空间群,包括具有不同晶胞形状、尺寸和原子位置的随机晶体结构,生成原子结构。
  • 对每个空间群结构施加形变,以采样广泛的原子环境和局部对称性。
  • 使用密度泛函理论(DFT)计算所有生成结构的参考能量、力和应力。
  • 使用完整数据集训练矩张量势(MTPs),并通过仔细选择截断半径和基组级别以确保可转移性。
  • 在缺陷(点缺陷、表面、晶界)上评估模型性能,并与基于其他数据集训练的MLIPs进行比较。
  • 通过在外部数据集(包括其他研究组的数据)上测试模型,评估其泛化能力,以衡量可转移性。

实验结果

研究问题

  • RQ1系统性地基于对称性采样晶体结构,是否能生成可转移至缺陷的机器学习原子间势,而无需在训练集中包含缺陷结构?
  • RQ2截断半径和基组级别的选择如何影响所生成MLIPs的准确性和可转移性,特别是针对表面和堆垛层错?
  • RQ3训练集的多样性——尤其是对所有空间群的覆盖——与传统或基于主动学习的训练集相比,能在多大程度上提升泛化能力?
  • RQ4一旦建立了足够多样且基于对称性的训练集,主动学习是否仍能提供额外优势?
  • RQ5在训练集全面且无偏的情况下,MLIPs是否能在外部数据集上表现优于基于更有限、应用特定数据训练的模型?

主要发现

  • 对所有空间群及其形变的系统性采样,生成的训练集使MLIPs能够准确描述镁的hcp和bcc相,而无需预先包含缺陷结构。
  • 所得到的MTPs在缺陷和表面上表现出极低的均方根误差(RMSE),其中截断半径8.2 Å且基组级别高于16是避免错误零堆垛层错能的关键。
  • 在全面的“Everything”数据集上训练的势函数,在外部数据测试中优于其他基于较小、应用特定数据集训练的MLIPs,展现出更优的可转移性。
  • 一旦使用了多样且基于对称性的训练集,主动学习对性能的提升并不显著,表明对于此类问题,数据多样性比迭代优化更为关键。
  • 即使不涉及外推,若未妥善管理插值误差,MLIPs仍可能产生非最优结果,凸显了训练集覆盖范围和基组质量的重要性。
  • 该方法可实现为镁构建通用、可转移的MLIPs,能准确描述平衡相和缺陷,且完整数据与代码已公开。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。