[论文解读] Taming Multi-Domain, -Fidelity Data: Towards Foundation Models for Atomistic Scale Simulations
本文提出总能量对齐(TEA)方法,用于在无需昂贵重新计算的情况下统一多领域、多保真度的量子化学数据集(涵盖有机分子与无机晶体)。通过TEA,作者训练出MACE-Osaka24——一个单一开源神经网络势函数,其在分子反应能垒与无机晶体性质预测方面均达到最先进精度,推动了原子模拟领域基础模型的普惠化发展。
Machine learning interatomic potentials (MLIPs) are changing atomistic simulations in the field of chemistry and materials science. However, constructing a single universal MLIP that can accurately model molecular and crystalline systems remains challenging. A central obstacle is the integration of diverse datasets generated under different computational conditions. We present Total Energy Alignment (TEA), which is an approach that enables the seamless integration of heterogeneous quantum chemical datasets without redundant calculations. Using TEA, we trained MACE-Osaka24, the first open-source MLIP model based on a unified dataset covering molecular and crystalline systems. This universal model displays strong performances across diverse chemical systems, exhibiting similar or improved accuracies in predicting organic reaction barriers compared to those of specialized models, while effectively maintaining state-of-the-art accuracies for inorganic systems. These advancements pave the way for accelerated discoveries in the fields of chemistry and materials science via genuine foundation models for chemistry.
研究动机与目标
- 解决在分子与晶体体系中,使用不同计算方法(如DFT泛函、基组)产生的异构量子化学数据集整合难题。
- 克服因计算资源限制而阻碍研究人员获取通用机器学习原子间势函数(MLIPs)的障碍。
- 开发一种统一的、开源的神经网络势函数,能够在一个模型中准确模拟有机分子与无机晶体。
- 实现超越传统分子与固态体系领域边界的化学基础模型的构建。
提出的方法
- 应用总能量对齐(TEA)方法,采用两步框架:首先对齐各数据集间的内层核心参考能量,随后通过缩放原子化能以协调总能量。
- 采用两阶段校准:使用共同参考点对齐各数据集中孤立原子的参考能量,随后通过缩放原子化能以校正泛函与基组差异。
- 在统一数据集上训练单一基于MACE的神经网络势函数(MACE-Osaka24),该数据集结合了MPtrj(无机)与OFF23(有机)数据集,同时保持各领域的特定精度。
- 利用MACE架构的旋量不变性与消息传递设计,确保在多样化化学环境中保持物理一致性。
- 通过标准基准测试验证模型:反应能垒预测、晶格常数优化,以及使用TIP3P与TIP4P/2005水模型的经典分子动力学模拟。
- 采用改进的OpenMM-ML接口实现机器学习驱动的分子动力学模拟,并引入D3(BJ)色散校正,以确保长期模拟的精度。
实验结果
研究问题
- RQ1能否在无需大量重新计算的情况下,将来自不同DFT泛函与基组的异构量子化学数据集统一?
- RQ2能否通过单一通用机器学习原子间势函数,在分子与晶体体系中均实现最先进精度?
- RQ3所提出的TEA方法是否能使计算资源有限的研究人员也能参与并受益于原子模拟中的基础模型开发?
- RQ4统一模型在预测多样化学体系的反应能垒与晶格常数方面,性能是否优于专用模型?
主要发现
- MACE-Osaka24在无机晶体晶格常数预测中达到0.0153 eV/atom的平均绝对误差(MAE),在分子反应能垒预测中达到0.0205 eV/atom,后者优于专用模型。
- 该模型在无机体系中保持最先进精度(非BCC晶体MAE < 0.02 Å),在有机反应能垒预测中表现与领域专用模型相当或更优。
- 对于BCC晶体(K、Rb、Cs),由于MACE-Osaka24的截断半径为4.5 Å,预测误差随晶格常数增大而上升,表明其在大晶胞结构中对长程相互作用的捕捉能力受限。
- TEA实现了无需重新计算总能量即可无缝整合MPtrj(无机)与OFF23(有机)数据集,显著降低计算开销,推动统一数据集的普惠化访问。
- 使用TIP4P/2005作为参考的MACE-Osaka24经典分子动力学模拟,在径向分布函数与自扩散系数方面与参考结果高度一致,证实了其长期稳定性和精度。
- 该模型在包括水簇与三肽在内的多样化化学环境中的表现稳健,展示了其在训练数据之外的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。