Skip to main content
QUICK REVIEW

[论文解读] Transition1x -- a Dataset for Building Generalizable Reactive Machine Learning Potentials

Mathias Schreiner, Arghya Bhowmik|arXiv (Cornell University)|Jul 25, 2022
Machine Learning in Materials Science被引用 8
一句话总结

Transition1x 是一个大规模、基于 DFT 生成的分子构型数据集,包含数百万个跨越反应路径的构型,通过使用 Nudged Elastic Band (NEB) 和 CINEB 方法系统地采样势能面的过渡态和高能区域。该数据集可实现通用反应性机器学习势的训练,其在过渡态预测上的精度显著优于 ANI1x 和 QM9x,尤其在反应能垒和动力学建模方面表现更优。

ABSTRACT

Machine Learning (ML) models have, in contrast to their usefulness in molecular dynamics studies, had limited success as surrogate potentials for reaction barrier search. It is due to the scarcity of training data in relevant transition state regions of chemical space. Currently, available datasets for training ML models on small molecular systems almost exclusively contain configurations at or near equilibrium. In this work, we present the dataset Transition1x containing 9.6 million Density Functional Theory (DFT) calculations of forces and energies of molecular configurations on and around reaction pathways at the wB97x/6-31G(d) level of theory. The data was generated by running Nudged Elastic Band (NEB) calculations with DFT on 10k reactions while saving intermediate calculations. We train state-of-the-art equivariant graph message-passing neural network models on Transition1x and cross-validate on the popular ANI1x and QM9 datasets. We show that ML models cannot learn features in transition-state regions solely by training on hitherto popular benchmark datasets. Transition1x is a new challenging benchmark that will provide an important step towards developing next-generation ML force fields that also work far away from equilibrium configurations and reactive systems.

研究动机与目标

  • 为解决当前缺乏全面、高质量的训练数据以支持反应性机器学习势在多样化化学反应中实现良好泛化的问题。
  • 克服现有数据集(如 ANI1x 和 QM9x)在采样过渡态和非平衡构型方面不足的局限性,这些构型对反应机理建模至关重要。
  • 开发一种可扩展、系统化的数据生成流程,利用 NEB 和 CINEB 方法高精度探索复杂的势能面。
  • 创建与 ANI1x 和 QM9x 兼容的数据集,支持混合训练,从而在反应动力学模拟中实现更优的泛化能力与性能表现。

提出的方法

  • 该数据集源自 Grambow 等人(2020)基于 GDB7 的数据集所提取的 11,961 个有机反应,涵盖 H、C、N 和 O 原子的所有组合。
  • 首先使用 BFGS 优化器(力阈值为 0.01 eV/Å)对反应物和产物几何结构进行优化,随后利用 IDPP 方法生成初始反应路径,确保其物理合理性。
  • 应用 Nudged Elastic Band (NEB) 方法以优化最小能量路径(MEP),并检查 500 次迭代内的收敛性;未收敛的路径将被舍弃。
  • 在 NEB 之后使用 CINEB 方法进一步优化路径,确保收敛至真实 MEP,并准确捕捉复杂的反应坐标特征。
  • 所有收敛路径中的中间构型若与先前存储的构型足够不同,则被保存,以确保势能面采样的多样性与非冗余性。
  • 所有电子结构计算均在 ωB97X-D3/6-31G(d) 理论水平下使用 ORCA 5.0.2 完成,确保高精度并兼容 ANI1x。

实验结果

研究问题

  • RQ1基于 NEB 的数据生成方法是否能产生比基于 MD 或随机采样的方法更具代表性与多样性的过渡态与高能构型数据集,以用于训练反应性机器学习势?
  • RQ2在预测过渡态与反应能垒时,基于 Transition1x 训练的机器学习模型性能是否优于基于 ANI1x 或 QM9x 训练的模型?
  • RQ3NEB 生成的构型在多大程度上提升了机器学习势在多样化反应类型与能量区域中的泛化能力?
  • RQ4Transition1x 是否可与 ANI1x 有效结合用于混合训练,以增强模型在反应动力学模拟中的表达能力与精度?

主要发现

  • 在 Transition1x 上训练的模型在预测过渡态方面显著优于在 ANI1x 和 QM9x 上训练的模型,其在同数据集测试集上的平均绝对误差明显更低。
  • 基于 NEB 的数据生成方法产生的构型在极端高能区域的原子间距离上更具现实性,优于 ANI1x 所采用的随机扰动方法。
  • Transition1x 比 ANI1x 捕捉到更广泛的重原子间距离分布,特别是在键断裂与形成区域,这些区域对反应建模至关重要。
  • ANI1x 未能充分采样过渡态区域,导致泛化能力差;在 ANI1x 上训练的模型在 Transition1x 测试数据上表现出高误差,表明其对反应性构型的覆盖不足。
  • QM9x 训练的模型在 ANI1x 和 Transition1x 上均表现欠佳,因其仅聚焦于平衡几何构型,凸显了在反应性势能训练中引入非平衡数据的必要性。
  • Transition1x 与 ANI1x 的兼容性支持混合训练,联合使用两个数据集训练的模型性能更优,表明不同数据源的结合具有协同增益效应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。