[论文解读] Robust Training of Machine Learning Interatomic Potentials with Dimensionality Reduction and Stratified Sampling
本文提出DIRECT采样方法——结合降维与分层采样,以选择用于机器学习原子间势(MLIPs)的稳健、多样化的训练集。通过在Materials Project的逾100万种结构上应用DIRECT,作者开发出一种更稳健的M3GNet通用势能,其对未见构型的泛化能力更强,并实现了对复杂体系(如钛氢化物)的瞬时张量势能的高效、高通量训练,无需迭代优化。
Machine learning interatomic potentials (MLIPs) enable the accurate simulation of materials at larger sizes and time scales, and play increasingly important roles in the computational understanding and design of materials. However, MLIPs are only as accurate and robust as the data they are trained on. In this work, we present DImensionality-Reduced Encoded Clusters with sTratified (DIRECT) sampling as an approach to select a robust training set of structures from a large and complex configuration space. By applying DIRECT sampling on the Materials Project relaxation trajectories dataset with over one million structures and 89 elements, we develop an improved materials 3-body graph network (M3GNet) universal potential that extrapolate more reliably to unseen structures. We further show that molecular dynamics (MD) simulations with universal potentials such as M3GNet can be used in place of expensive extit{ab initio} MD to rapidly create a large configuration space for target materials systems. Combined with DIRECT sampling, we develop a highly reliable moment tensor potential for Ti-H system without the need for iterative optimization. This work paves the way towards robust high throughput development of MLIPs across any compositional complexity.
研究动机与目标
- 解决构建稳健、可泛化机器学习原子间势(MLIPs)的挑战,使其在未见材料构型上表现良好。
- 通过在DFT计算前预先选择多样化、信息丰富的训练数据,减少对昂贵且迭代的主动学习的依赖。
- 实现在复杂成分空间(包括多主元元素与氢化物体系)中通用MLIP的高通量开发。
- 通过系统性采样确保构型空间的全面覆盖,提升MLIP的外推性能。
- 证明基于通用势能的分子动力学模拟可生成大规模、多样化的训练数据,从而减少对从头计算数据收集的需求。
提出的方法
- 应用降维(自编码器)将原子结构表征压缩至低维潜在空间,以实现高效聚类。
- 在潜在空间中使用k-means聚类,识别构型空间中具有代表性的结构簇。
- 实施分层采样,确保最终训练集中各类簇的代表性比例均衡,最大化多样性与覆盖度。
- 将DIRECT采样与基于预训练M3GNet通用势能的分子动力学模拟相结合,生成更多多样化构型用于训练。
- 在DIRECT采样数据集上训练M3GNet与瞬时张量势能(MTP)模型,并在未见结构上评估泛化性能。
- 通过DFT计算的能量与力对测试集进行性能验证,测试集包括假设化合物与Ti-H体系。

实验结果
研究问题
- RQ1降维与分层采样能否有效从海量构型空间中识别出多样化且具代表性的结构子集?
- RQ2与传统或基于主动学习的采样方法相比,DIRECT采样是否能提升机器学习原子间势的泛化性与鲁棒性?
- RQ3基于通用势能(如M3GNet)驱动的分子动力学模拟能否在无先验DFT数据的情况下,为新材料体系生成高质量训练数据?
- RQ4DIRECT采样训练集在多大程度上可减少训练瞬时张量势能时对迭代主动学习的需求?
- RQ5采用DIRECT采样训练的MLIP在多大程度上能外推至假设化合物与复杂材料(如多元素氢化物)?
主要发现
- DIRECT采样从Materials Project数据集中超过130万种结构中,仅通过选择高度多样化且具代表性的训练集,显著减少了所需DFT计算次数。
- 使用DIRECT采样训练的M3GNet通用势能在未见结构上的外推性能显著优于采用标准采样或主动学习采样训练的模型。
- 基于M3GNet通用势能的分子动力学模拟成功生成了27.4万个Ti-H构型的大型多样化数据集,用于训练稳健的瞬时张量势能,且无需迭代优化。
- M3GNet-DIRECT势能在假设O-和S-含氧化合物测试集上实现了12.8 meV/atom的平均绝对误差与124.3 meV/atom的最大误差,展现出强大的泛化能力。
- 在Ti-H体系上基于DIRECT采样数据训练的瞬时张量势能在500多个结构的测试集上实现了14.5 meV/atom的平均绝对误差,且无需主动学习迭代。
- DIRECT采样流程已开源至maml Python库,支持可复现性与在材料科学研究中的广泛应用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。