Skip to main content
QUICK REVIEW

[论文解读] Efficient machine-learning surrogates for large-scale geological carbon and energy storage

Teeratorn Kadeethum, Stephen Verzi|arXiv (Cornell University)|Oct 11, 2023
Reservoir Engineering and Simulation Methods被引用 4
一句话总结

本文提出了一种计算高效的神经算子(NO)代理模型,用于大规模地质碳与能源储存,通过域分解和拓扑感知嵌入实现训练域与推理域的解耦。该方法通过使用子域降低训练成本,同时实现精确的全场预测,在伊利诺伊盆地-迪凯特项目中仅使用90个训练样本即实现<1%的相对误差。

ABSTRACT

Geological carbon and energy storage are pivotal for achieving net-zero carbon emissions and addressing climate change. However, they face uncertainties due to geological factors and operational limitations, resulting in possibilities of induced seismic events or groundwater contamination. To overcome these challenges, we propose a specialized machine-learning (ML) model to manage extensive reservoir models efficiently. While ML approaches hold promise for geological carbon storage, the substantial computational resources required for large-scale analysis are the obstacle. We've developed a method to reduce the training cost for deep neural operator models, using domain decomposition and a topology embedder to link spatio-temporal points. This approach allows accurate predictions within the model's domain, even for untrained data, enhancing ML efficiency for large-scale geological storage applications.

研究动机与目标

  • 解决在地质碳与能源储存中大规模地下流模拟的深度神经算子(NO)训练高计算成本问题。
  • 通过域分解解耦训练与预测域,克服在全域数据上训练NO的瓶颈。
  • 利用拓扑嵌入器实现在任意时空点的准确全场预测(插值),即使在训练子域之外也能实现,确保跨域一致性。
  • 减小模型大小与计算复杂度,以支持在资源受限的边缘设备上部署。
  • 在极小训练数据量下实现高精度,降低数据生成成本,提升工业应用的可扩展性。

提出的方法

  • 在训练过程中将计算域分解为更小的子域,每个反向传播步骤仅使用部分时空点。
  • 采用拓扑嵌入器将输入与输出空间中的对应时空坐标进行映射,实现跨域的一致插值。
  • 在缩减的子域上训练NO模型,同时在推理阶段保持预测全场解的能力。
  • 采用紧凑架构,参数量为186万,模型大小21 MB,可在CPU或GPU上实现高效推理。
  • 利用量化与剪枝技术进一步减小模型大小与计算成本,以支持边缘设备部署。
  • 未来工作将集成物理先验与自适应采样,以提升高梯度区域的预测精度。
Figure 1: Schematic of the proposed improved neural operator.
Figure 1: Schematic of the proposed improved neural operator.

实验结果

研究问题

  • RQ1在地下流模拟中,训练阶段的域分解是否能显著降低大规模神经算子模型的计算成本?
  • RQ2在子域上训练的神经算子模型在多大程度上能通过插值实现准确的全场预测?
  • RQ3在工业规模的地质储存应用中,实现高精度所需的最少训练样本数量是多少?
  • RQ4所提出的框架是否能在资源受限的边缘设备上高效部署,同时不牺牲预测速度或精度?
  • RQ5量化与剪枝等模型压缩技术对地下系统机器学习代理模型的性能与可部署性有何影响?

主要发现

  • 在仅使用90个训练样本的情况下,该模型在伊利诺伊盆地-迪凯特项目(一个大规模碳储存场地)的测试集上实现了小于1%的相对误差。
  • 在单张Quadro RTX 8000 GPU上,对具有173万自由度的单个时间步长的推理耗时约0.003秒,支持实时应用。
  • 模型可在CPU上进行推理,仅导致壁时略有增加,展现出面向边缘部署的灵活性。
  • 模型大小仅为21 MB,参数量186万,乘加操作数(MACs)为186万,显著小于标准模型如ResNet50(100 MB,4.14 GMACs)。
  • 即使训练点稀疏分布,该框架仍能实现全域的准确插值,避免外推。
  • 该方法将训练复杂度与域大小解耦,使得在不产生禁止性计算成本的前提下,可在大规模储层模型上进行训练。
Figure 2: Illustration of input parameters: (a) permeability and (b) porosity.
Figure 2: Illustration of input parameters: (a) permeability and (b) porosity.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。