[论文解读] On Deriving Probabilistic Models for Adsorption Energy on Transition Metals using Multi-level Ab initio and Experimental Data
该论文提出了一种多任务高斯过程(MT-GP)框架,通过融合低精度DFT数据与高精度RPA或实验数据,实现了对过渡金属吸附能的高精度预测。通过利用大量低精度数据并选择性地引入有限的高精度数据,MT-GP在显著降低高精度数据需求量(最高达80%)的同时,保持了低于0.12 eV的平均绝对误差,性能远超单任务模型。
In this paper, we apply multi-task Gaussian Process (MT-GP) to show that the adsorption energy of small adsorbates on transition metal surfaces can be modeled to a high level of fidelity using data from multiple sources, taking advantage of the relatively abundant ''low fidelity" data (such as from density functional theory computations) and small amounts of ''high fidelity" computational (e.g. using the random phase approximation) or experimental data. To fully explore the performance of MT-GP, we perform two case studies - one using purely computational datasets and the other using a combination of experimental and computational datasets. In both cases, the performance of MT-GPs is significantly better than single-task models built on a single data source. This method can be used to learn improved models from fused datasets, and thereby build accurate models under tight computational and experimental budget.
研究动机与目标
- 开发一种数据驱动模型,通过整合多层次的理论与实验数据,提升过渡金属表面吸附能的预测精度。
- 通过利用低精度DFT数据作为先验,减少对昂贵高精度数据的依赖,缓解RPA等高级理论的计算瓶颈。
- 证明多任务高斯过程可优于仅基于单一数据源训练的单任务模型。
- 通过主动学习选择最具信息量的高精度数据点,优化数据采集过程,降低实验或计算成本。
- 在纯计算数据集与混合实验-计算数据集上验证模型性能,展示其在不同数据精度水平下的鲁棒性。
提出的方法
- 采用多任务高斯过程(MT-GP)回归,利用多种精度等级的数据源(如PBE、BEEF-vdW,低精度DFT;RPA,高精度理论;实验测量)建模吸附能。
- 使用能够刻画不同精度等级之间相关性的核函数,实现从低精度任务向高精度任务的信息迁移。
- 通过路径指纹和电子结构特征(如d带中心)表示表面物种,以编码特定表面的化学环境。
- 采用以预测方差为采集标准的主动学习方法,迭代选择最具信息量的高精度数据点(如FC-RPA),以最小化所需高精度样本数量。
- 在源任务(如FC-PBE、FC-BEEF)与目标任务(如FC-RPA或实验数据)的组合数据上训练MT-GP模型,使用交叉验证及平均绝对误差(MAE)和平均预测标准差(MPSd)等误差指标进行评估。
- 通过10折交叉验证评估模型性能,并与仅基于单一数据源训练的单任务GP模型进行对比,量化性能提升。
实验结果
研究问题
- RQ1多任务高斯过程能否有效融合低精度DFT数据与高精度RPA或实验数据,从而提升对过渡金属吸附能的预测精度?
- RQ2随着低精度数据量的增加,为达到目标预测精度,所需高精度数据点的数量如何变化?
- RQ3与随机采样相比,主动学习在多大程度上可减少所需高精度数据点的数量,同时保持模型性能?
- RQ4低精度泛函的选择(如PBE与BEEF-vdW)在多大程度上影响MT-GP模型的性能与泛化能力?
- RQ5MT-GP模型在预测精度与不确定性量化方面,是否优于仅基于单一数据源(如仅RPA或仅实验数据)训练的单任务模型?
主要发现
- 在FC-PBE与FC-BEEF作为源任务的MT-GP模型,在FC-RPA目标集上实现了0.12 eV的平均绝对误差(MAE),显著优于单任务模型。
- 当使用200个FC-PBE数据点作为源时,MT-GP达到与使用完整FC-RPA数据集的单任务GP模型相当的精度,且所需FC-RPA数据点少于10个。
- 仅使用60个FC-RPA数据点,MT-GP即实现了接近使用180个FC-RPA数据点训练的模型的精度,且后者需配合完整的FC-PBE数据,表明高精度数据需求量降低了67%。
- MT-GP中的平均预测标准差(MPSd)作为不确定性估计器表现可靠:初期因数据稀缺而低估误差,但随后能良好跟踪MAE,从而支持主动学习的早期终止。
- MT-GP中FC-BEEF与FC-RPA的相关性强于FC-PBE与FC-RPA之间,可能归因于BEEF-vdW在表面科学数据上的参数化,从而降低了系统性误差。
- 随着低精度数据点数量的增加,达到目标精度所需的高精度数据点数量减少——例如,当使用100个FC-PBE数据点时需140个FC-RPA点,而使用200个FC-PBE数据点时仅需60个FC-RPA点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。