Skip to main content
QUICK REVIEW

[论文解读] Machine Learning For Elliptic PDEs: Fast Rate Generalization Bound, Neural Scaling Law and Minimax Optimality

Yiping Lu, Haoxuan Chen|arXiv (Cornell University)|Oct 13, 2021
Model Reduction and Neural Networks参考文献 12被引用 11
一句话总结

本文为椭圆PDE的深度学习求解器,特别是Deep Ritz方法(DRM)和物理信息神经网络(PINNs),建立了快速率泛化界。证明了PINNs和改进版DRM的极小极大最优性,推导出依赖维度的神经网络尺度律,并表明标准DRM由于H¹范数中采样引起的方差而次优,从而限制了收敛速率。

ABSTRACT

In this paper, we study the statistical limits of deep learning techniques for solving elliptic partial differential equations (PDEs) from random samples using the Deep Ritz Method (DRM) and Physics-Informed Neural Networks (PINNs). To simplify the problem, we focus on a prototype elliptic PDE: the Schrödinger equation on a hypercube with zero Dirichlet boundary condition, which has wide application in the quantum-mechanical systems. We establish upper and lower bounds for both methods, which improves upon concurrently developed upper bounds for this problem via a fast rate generalization bound. We discover that the current Deep Ritz Methods is sub-optimal and propose a modified version of it. We also prove that PINN and the modified version of DRM can achieve minimax optimal bounds over Sobolev spaces. Empirically, following recent work which has shown that the deep model accuracy will improve with growing training sets according to a power law, we supply computational experiments to show a similar behavior of dimension dependent power law for deep PDE solvers.

研究动机与目标

  • 为基于深度学习的椭圆PDE求解器,特别是DRM和PINNs,建立理论统计极限。
  • 利用快速率边界分析DRM和PINNs的泛化误差,改进先前的慢速率$O(1/ ol)$结果。
  • 识别标准Deep Ritz方法因H¹范数中采样引起的方差而导致次优的原因。
  • 提出一种改进的DRM,使其在Sobolev空间上实现极小极大最优收敛速率。
  • 通过实验证明深度PDE求解器中存在神经网络尺度律,表明误差随训练数据量呈幂律衰减。

提出的方法

  • 通过利用其损失函数的强凸结构,推导出DRM和PINNs的$O(1/n)$阶快速率泛化边界。
  • 使用矩阵Bernstein不等式,界定了解的样本H¹范数与期望H¹范数之间的差异,揭示了标准DRM中占主导地位的$Z^d/n$项,该形式主导了方差。
  • 将DRM目标函数表述为傅里叶系数上的二次优化问题,从而实现标准估计量与经验解之间的比较。
  • 通过校正H¹范数中由采样引起的偏差,提出一种改进的DRM,从而实现更优的收敛速率。
  • 利用Fano不等式和Varshamov-Gilbert引理建立极小极大下界,证明PINNs和改进DRM的上界具有最优性。
  • 通过数值实验验证测试误差与训练集大小之间存在幂律缩放关系,与其它深度学习任务中的神经网络尺度律一致。

实验结果

研究问题

  • RQ1能否为求解椭圆PDE的DRM和PINNs建立快速率泛化边界?
  • RQ2为何标准Deep Ritz方法次优?其收敛速率较慢的原因是什么?
  • RQ3能否通过改进DRM版本在Sobolev空间上实现极小极大最优收敛速率?
  • RQ4深度PDE求解器是否遵循神经网络尺度律,即误差随训练数据量呈幂律衰减?
  • RQ5所提出的泛化误差上界是否紧致,是否通过信息论下界得到验证?

主要发现

  • 本文为DRM和PINNs均建立了$O(1/n)$阶的快速率泛化边界,优于先前的$O(1/ ol)$边界。
  • 标准DRM被证明因$Z^d/n$阶的采样引起的方差项而次优,该方差项主导了最优率中的$Z^{d-2}/n$项。
  • 提出一种改进的DRM版本,通过校正该采样偏差,实现了极小极大最优收敛速率$n^{-\frac{2s-2}{d+2s-4}}$。
  • PINNs和改进DRM被证明在Sobolev空间上达到极小极大最优速率,与信息论下界一致。
  • 数值实验确认测试误差与训练集大小之间存在幂律缩放关系,幂指数$ \propto 1/d$,与其它深度学习任务中的神经网络尺度律一致。
  • 理论分析表明,DRM的收敛速率受限于经验算子与期望算子之间H¹范数的差异,而这种差异在标准近似误差分析中未被捕捉。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。