Skip to main content
QUICK REVIEW

[论文解读] The Cost-Accuracy Trade-Off In Operator Learning With Neural Networks

Maarten V. de Hoop, Daniel Zhengyu Huang|arXiv (Cornell University)|Mar 24, 2022
Model Reduction and Neural Networks被引用 7
一句话总结

本文对神经算子学习中PDE的代价-精度权衡进行了全面的数值研究,对比了PCA-Net、DeepONet、PARA-Net和FNO在四个基准问题上的表现。结果表明,FNO由于参数效率高且推理成本低,尤其在大规模场景下,实现了最佳的精度-代价权衡;而参数量和数据量对各类架构的性能均有显著影响。

ABSTRACT

The term `surrogate modeling' in computational science and engineering refers to the development of computationally efficient approximations for expensive simulations, such as those arising from numerical solution of partial differential equations (PDEs). Surrogate modeling is an enabling methodology for many-query computations in science and engineering, which include iterative methods in optimization and sampling methods in uncertainty quantification. Over the last few years, several approaches to surrogate modeling for PDEs using neural networks have emerged, motivated by successes in using neural networks to approximate nonlinear maps in other areas. In principle, the relative merits of these different approaches can be evaluated by understanding, for each one, the cost required to achieve a given level of accuracy. However, the absence of a complete theory of approximation error for these approaches makes it difficult to assess this cost-accuracy trade-off. The purpose of the paper is to provide a careful numerical study of this issue, comparing a variety of different neural network architectures for operator approximation across a range of problems arising from PDE models in continuum mechanics.

研究动机与目标

  • 通过实证方法研究神经算子学习中PDE的代价-精度权衡,其中代价指在线推理时间,精度指泛化误差。
  • 分离并量化模型参数量和训练数据量对算子近似性能的影响。
  • 在连续介质力学中的多种PDE问题上,比较四种神经网络架构(PCA-Net、DeepONet、PARA-Net和FNO)的相对效率。
  • 通过解耦模型容量(参数)和数据量带来的误差,同时保持离散化和优化方法不变,为未来理论分析奠定基础。
  • 通过识别在推理阶段计算成本最低但精度最高的架构,指导神经算子的实际部署。

提出的方法

  • 采用四种神经算子架构:PCA-Net(基于PCA)、DeepONet(分支-主干结构)、PARA-Net(逐点前馈)和FNO(基于傅里叶),所有模型均在PDE解上进行训练。
  • 使用固定的随机梯度下降法,采用标准超参数以最小化训练损失,从而隔离架构和数据量的影响。
  • 将计算代价定义为每次推理的在线评估代价,基于矩阵运算和逐层复杂度公式推导得出。
  • 通过各层维度和激活成本的解析计算,分析每种架构的参数复杂度,实现在不同模型规模下的可比性。
  • 在不同训练数据量和网络规模(如w或df从16到512)下,对保留的测试数据进行泛化误差评估。
  • 通过消融实验固定离散化和优化器,聚焦于模型容量(参数)和数据量对误差的贡献。

实验结果

研究问题

  • RQ1不同神经算子架构的测试误差如何随训练数据量增加而变化?
  • RQ2每种神经算子架构的模型参数量与推理代价之间存在何种关系?
  • RQ3在多个PDE问题中,哪种架构实现了最佳的精度-代价权衡?
  • RQ4在相同问题设置下,FNO、DeepONet、PCA-Net和PARA-Net的参数和评估代价复杂度如何比较?
  • RQ5数据量和模型容量在多大程度上独立影响神经算子的泛化误差?

主要发现

  • FNO在所有问题中均实现了最低的测试误差和最低的评估代价,尤其在大网络规模下表现更优,归因于其参数效率高且傅里叶运算成本低。
  • 在大规模数据量下(如512个样本),FNO在Navier-Stokes问题上d_f=32时,测试误差约为1.5e-3,评估代价低于100毫秒。
  • PARA-Net在参数量低于DeepONet和PCA-Net的情况下表现优异,在中等数据量下,Helmholtz和结构力学问题的测试误差低于1e-3。
  • DeepONet在四类架构中参数量和评估代价最高,Navier-Stokes问题在d_f=32时参数超过300万,但仅在大规模数据量下才能达到有竞争力的精度。
  • PCA-Net具有很高的参数效率,但由于PCA投影和重构步骤,每样本的评估代价较高,尤其在大N_p时更为明显。
  • 所有架构的代价-精度曲线在某一数据量后均呈现收益递减趋势,FNO和PARA-Net在某些情况下仅需不到100个训练样本即可接近最优精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。