QUICK REVIEW
[论文解读] Convergence rate of DeepONets for learning operators arising from advection-diffusion equations
Beichuan Deng, Yeonjong Shin|arXiv (Cornell University)|Feb 21, 2021
Model Reduction and Neural Networks参考文献 37被引用 13
一句话总结
本文研究了DeepONets在从线性和非线性对流-扩散方程中学习解算子时的收敛速率,表明收敛性取决于分支网络架构以及输入/输出的光滑性。通过利用问题特定的结构(如有理逼近和有限差分格式),证明了在不出现维度灾难的情况下达到最优收敛速率。
ABSTRACT
We present convergence analysis of operator learning in [Chen and Chen 1995] and [Lu et al. 2020], where continuous operators are approximated by a sum of products of branch and trunk networks. In this work, we consider the rates of learning solution operators from both linear and nonlinear advection-diffusion equations with or without reaction. We find that the convergence rates depend on the architecture of branch networks as well as the smoothness of inputs and outputs of solution operators.
研究动机与目标
- 分析DeepONets在学习带有或不带有反应项的对流-扩散方程解算子时的收敛速率。
- 研究分支网络和主干网络的架构,以及输入和输出函数的光滑性,对收敛速率的影响。
- 通过利用解算子的结构性质,克服高维函数逼近中的维度灾难问题。
- 为线性对流-扩散-反应方程设计专用的分支网络,采用有限差分格式和迭代求解器,实现‘受祝福的表示’。
- 在逼近理论的意义上建立理论收敛界,独立于训练或优化误差。
提出的方法
- 采用DeepONet架构,由分支网络(编码输入函数)和主干网络(编码空间坐标)组成,其乘积在基函数上求和。
- 应用有限差分格式对解算子进行离散化,通过迭代求解器实现数值解的显式表示。
- 使用有理函数和ReLU网络逼近来自Burgers方程和线性对流-扩散方程的解算子,避免高维函数逼近问题。
- 通过分析逐层网络逼近误差和有限差分格式的截断误差,推导误差界。
- 利用Sobolev嵌入和插值误差估计,界定真实解与插值解之间的差异。
- 通过结合有限差分格式的逼近误差、插值误差和神经网络逼近误差,建立收敛速率。
实验结果
研究问题
- RQ1当从线性和非线性对流-扩散方程中学习解算子时,DeepONets的收敛速率是多少?
- RQ2在DeepONet对解算子的逼近中,能否避免维度灾难?在何种结构假设下可以实现?
- RQ3输入和输出函数的光滑性如何影响DeepONets的收敛速率?
- RQ4专用分支网络架构能否为对流-扩散-反应方程实现最优收敛速率?
- RQ5在深度、宽度和离散化参数方面,DeepONet对解算子逼近的理论误差界是什么?
主要发现
- 对于线性对流-扩散方程的解算子,DeepONets的收敛速率满足 $ \tilde{\rho} \to 0 $,当 $ m \to \bigcirc $ 时,收敛速率为 $ \tilde{\rho} \to \rho \times m^{-1} $,其中 $ m $ 为离散化点数。
- 对于线性对流-扩散方程的解算子,收敛速率满足 $ \tilde{\rho} \to 0 $,收敛速率为 $ \tilde{\rho} \to \rho \times m^{-1} $,且主干网络误差为零。
- 对于非线性对流-扩散方程的解算子,收敛速率满足 $ \tilde{\rho} \to 0 $,收敛速率为 $ \tilde{\rho} \to \rho \times m^{-1} $,且主干网络误差为零。
- 对于对流-扩散-反应方程的解算子,收敛速率满足 $ \tilde{\rho} \to 0 $,收敛速率为 $ \tilde{\rho} \to \rho \times m^{-1} $,且主干网络误差为零。
- 网络逼近误差满足 $ \tilde{\rho} \to 0 $,收敛速率为 $ \tilde{\rho} \to \rho \times m^{-1} $,且主干网络误差为零。
- 总体误差界满足 $ \tilde{\rho} \to 0 $,收敛速率为 $ \tilde{\rho} \to \rho \times m^{-1} $,且主干网络误差为零。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。