Skip to main content
QUICK REVIEW

[论文解读] Momentum Diminishes the Effect of Spectral Bias in Physics-Informed Neural Networks

Ghazal Farhani, Alexander Kazachek|arXiv (Cornell University)|Jun 29, 2022
Model Reduction and Neural Networks被引用 4
一句话总结

本文表明,带有动量的随机梯度下降(SGDM)能显著降低物理信息神经网络(PINNs)中的谱偏差,使模型即使在高频偏微分方程(PDE)问题中也能收敛到高精度解。基于神经正切核(NTK)理论,作者证明SGDM通过平衡低频与高频特征的收敛速度,改善了学习动态,其性能优于普通SGD,并使更宽的网络能够实现高精度解。

ABSTRACT

Physics-informed neural network (PINN) algorithms have shown promising results in solving a wide range of problems involving partial differential equations (PDEs). However, they often fail to converge to desirable solutions when the target function contains high-frequency features, due to a phenomenon known as spectral bias. In the present work, we exploit neural tangent kernels (NTKs) to investigate the training dynamics of PINNs evolving under stochastic gradient descent with momentum (SGDM). This demonstrates SGDM significantly reduces the effect of spectral bias. We have also examined why training a model via the Adam optimizer can accelerate the convergence while reducing the spectral bias. Moreover, our numerical experiments have confirmed that wide-enough networks using SGDM still converge to desirable solutions, even in the presence of high-frequency features. In fact, we show that the width of a network plays a critical role in convergence.

研究动机与目标

  • 解决PINNs中长期存在的谱偏差问题,即模型难以学习PDE解中的高频特征。
  • 研究为何标准SGD在高频PDE问题中表现不佳,原因在于其训练动态中存在强烈的谱偏差。
  • 探讨优化中的动量(SGDM)和自适应方法(Adam)如何缓解谱偏差并加速收敛。
  • 证明网络宽度在减少高频问题误差方面起着关键作用,即使在实际有限宽度的网络中也是如此。
  • 提供理论与实证证据,表明SGDM通过改变梯度流动力学,使高频PDE问题能够收敛到高精度解。

提出的方法

  • 利用神经正切核(NTK)理论,分析SGDM优化下无限宽PINNs的梯度流动力学。
  • 基于NTK分析,将训练过程建模为连续时间动力系统,研究不同频率分量的收敛行为。
  • 比较SGDM下低频与高频特征的收敛速率,表明动量减缓了低频特征的学习,同时加速了高频分量的收敛。
  • 通过固定深度、有限宽度网络的数值实验,验证网络宽度和优化器选择对结果的影响。
  • 在基准PDE(泊松方程、对流方程、反应-扩散方程)上实现PINNs,使用SGDM和Adam优化器,并逐步增加频率参数。
  • 通过预测解与解析解之间的相对误差,量化不同网络宽度和超参数下的解精度。

实验结果

研究问题

  • RQ1带有动量的随机梯度下降(SGDM)如何影响物理信息神经网络(PINNs)在求解PDE时的谱偏差?
  • RQ2为何Adam优化器相比普通SGD能加速PINNs的收敛?它如何影响谱偏差?
  • RQ3增加PINN宽度在多大程度上能缓解谱偏差,并提升高频PDE的解精度?
  • RQ4SGDM下无限宽PINNs的理论收敛动力学能否推广到实际的有限宽度网络?
  • RQ5在SGDM下,低频与高频分量的训练动态有何不同?动量在平衡两者收敛中起到什么作用?

主要发现

  • SGDM通过减缓低频特征的收敛速度并加速高频分量的收敛,显著降低了PINNs中的谱偏差,从而在不同频率分量间实现了更均衡的学习。
  • 对于高频PDE,普通SGD因高频分量所需学习率极低而无法收敛,而SGDM即使在挑战性情况下也能实现收敛。
  • 数值实验表明,更宽的网络(如宽度500)在高频问题上的相对误差可达到10⁻³量级,而更窄的网络(宽度50)的误差则在10⁻¹量级。
  • 在具有高参数的反应-扩散方程和传输方程中(如ν=23, ρ=25, β=100),SGDM和Adam在更少的训练轮次后均显著优于普通SGD,误差更低。
  • 在某些情况下,SGDM的收敛速度优于Adam,尽管Adam仍因自适应学习率而优于普通SGD。
  • 基于NTK的理论分析表明,SGDM对低频分量诱导欠阻尼振荡动力学,对高频分量则诱导临界阻尼振荡动力学,与普通SGD相比,谱偏差更小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。