Skip to main content
QUICK REVIEW

[论文解读] The Open DAC 2023 Dataset and Challenges for Sorbent Discovery in Direct Air Capture

Anuroop Sriram, Sihoon Choi|arXiv (Cornell University)|Nov 1, 2023
Metal-Organic Frameworks: Synthesis and Applications被引用 4
一句话总结

本论文介绍了 Open DAC 2023 (ODAC23) 数据集,这是迄今为止最大的基于DFT的金属有机框架(MOF)吸附性质数据集,包含对8,400种MOF材料在吸附CO₂和/或H₂O条件下的超过3800万次DFT计算。该数据集可支持高精度机器学习模型用于直接空气捕集(DAC)吸附剂的发现,实现能量预测误差低于0.02 eV,并能稳健预测结构弛豫,其中最先进的模型如GemNet-OC和EquiformerV2在能量和力的预测中表现出高精度。

ABSTRACT

New methods for carbon dioxide removal are urgently needed to combat global climate change. Direct air capture (DAC) is an emerging technology to capture carbon dioxide directly from ambient air. Metal-organic frameworks (MOFs) have been widely studied as potentially customizable adsorbents for DAC. However, discovering promising MOF sorbents for DAC is challenging because of the vast chemical space to explore and the need to understand materials as functions of humidity and temperature. We explore a computational approach benefiting from recent innovations in machine learning (ML) and present a dataset named Open DAC 2023 (ODAC23) consisting of more than 38M density functional theory (DFT) calculations on more than 8,400 MOF materials containing adsorbed $CO_2$ and/or $H_2O$. ODAC23 is by far the largest dataset of MOF adsorption calculations at the DFT level of accuracy currently available. In addition to probing properties of adsorbed molecules, the dataset is a rich source of information on structural relaxation of MOFs, which will be useful in many contexts beyond specific applications for DAC. A large number of MOFs with promising properties for DAC are identified directly in ODAC23. We also trained state-of-the-art ML models on this dataset to approximate calculations at the DFT level. This open-source dataset and our initial ML models will provide an important baseline for future efforts to identify MOFs for a wide range of applications, including DAC.

研究动机与目标

  • 为应对在真实湿度和温度条件下对直接空气捕集(DAC)MOF材料进行高通量、高精度计算筛选的迫切需求。
  • 通过提供CO₂和H₂O在MOF中吸附的DFT级别精度,克服经典力场和现有数据库的局限性。
  • 创建一个全面的开源数据集,包含8,400种MOF的结构弛豫和吸附能量数据,支持大规模机器学习驱动的材料发现。
  • 在ODAC23数据集上训练并基准测试最先进的图神经网络模型,用于预测DFT级别的能量和力,从而实现MOF吸附剂的快速且高精度的虚拟筛选。

提出的方法

  • 使用密度泛函理论(DFT)在DFT精度级别下,对8,400种MOF结构在吸附CO₂和/或H₂O条件下的计算进行了超过3800万次DFT计算。
  • 对MOF-吸附剂体系执行了完整的结构弛豫,以捕捉吸附条件下晶格和原子重排。
  • 利用DDEC点电荷和Ewald求和方法校准经典力场(UFF4MOF,结合TraPPE和SPC/E模型)以进行对比分析。
  • 在ODAC23数据集上训练了多种最先进的图神经网络模型——SchNet、DimeNet++、GemNet-OC、PaiNN、eSCN和EquiformerV2,用于能量和力的预测。
  • 采用均方误差(MAE)、能量阈值内比例(EwT)、距离阈值内平均值(ADwT)和力低于阈值比例(FbT)等指标评估模型性能,以衡量结构预测的准确性。
  • 使用L-BFGS优化方法进行基于机器学习的结构弛豫,以解决IS2RE和IS2RS任务,同时将直接IS2RE预测作为替代方法。

实验结果

研究问题

  • RQ1大规模、DFT精度的MOF-吸附剂体系数据集是否能够提升机器学习模型在直接空气捕集材料中吸附能和结构弛豫预测的性能?
  • RQ2最先进的图神经网络在预测CO₂和H₂O吸附MOF的DFT级别能量和力方面表现如何,特别是在竞争性双分子吸附条件下?
  • RQ3与DFT相比,经典力场在捕捉具有开放金属位点或复杂相互作用的MOF中吸附能和结构弛豫方面失败的程度有多大?
  • RQ4同时包含CO₂和H₂O吸附数据对机器学习模型在DAC吸附剂发现中的泛化能力和预测性能有何影响?
  • RQ5基于ODAC23训练的高精度机器学习模型是否能够实现比传统DFT或力场方法更快、更可靠的MOF虚拟筛选?

主要发现

  • ODAC23数据集包含对8,400种MOF在吸附CO₂和/或H₂O条件下进行的超过3800万次DFT计算,是目前同类中规模最大的DFT级别数据集。
  • 表现最佳的机器学习模型——GemNet-OC、eSCN和EquiformerV2——在预测弛豫结构的DFT能量时,平均绝对误差(MAE)低于0.02 eV。
  • 在结构弛豫方面,最佳模型在原子位置与DFT弛豫结构偏差小于0.1 Å的条件下,实现了超过90%的平均距离阈值内比例(ADwT)。
  • 力低于阈值(FbT)指标显示,超过85%的预测弛豫结构中,最大原子受力低于50 meV/Å,表明其已收敛至局部能量极小值。
  • 该数据集可直接用于识别具有优异DAC性能的MOF材料,包括在高湿度条件下具有高CO₂吸附量和良好选择性的材料。
  • 数据集及训练模型的开源发布,为未来基于MOF的直接空气捕集和材料发现研究提供了关键基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。