[论文解读] Frequency Principle in Deep Learning with General Loss Functions and Its Potential Application
本文证明了频率原则(F-Principle)——即深度神经网络(DNNs)在训练过程中优先学习低频分量,随后才学习高频分量——适用于一般损失函数,包括均方误差和交叉熵。作者通过理论分析和实验验证了这一点,表明DNN能够加速求解微分方程时的低频收敛,并提出了一种混合DNN-Jacobi方法,利用DNN捕捉低频分量,同时借助经典求解器对高频分量进行精细化处理。
Previous studies have shown that deep neural networks (DNNs) with common settings often capture target functions from low to high frequency, which is called Frequency Principle (F-Principle). It has also been shown that F-Principle can provide an understanding to the often observed good generalization ability of DNNs. However, previous studies focused on the loss function of mean square error, while various loss functions are used in practice. In this work, we show that the F-Principle holds for a general loss function (e.g., mean square error, cross entropy, etc.). In addition, DNN's F-Principle may be applied to develop numerical schemes for solving various problems which would benefit from a fast converging of low frequency. As an example of the potential usage of F-Principle, we apply DNN in solving differential equations, in which conventional methods (e.g., Jacobi method) is usually slow in solving problems due to the convergence from high to low frequency.
研究动机与目标
- 建立频率原则(F-Principle)不仅适用于均方误差损失,还可推广至其他常见损失函数(如交叉熵)的理论基础。
- 探究是否可利用F-Principle改进微分方程的数值求解方法,特别是那些在经典迭代方法中低频收敛缓慢的问题。
- 提出并验证一种结合DNN与经典迭代求解器(如雅可比法)的混合数值格式,通过利用DNN固有的低频优先特性来加速收敛。
- 提供理论与实证证据,表明使用一般损失函数的DNN训练动力学仍表现出从低频到高频的顺序学习特性。
提出的方法
- 对使用一般损失函数的DNN训练中的梯度流进行理论分析,表明由于激活函数的谱衰减特性,损失梯度的频率响应倾向于低频分量。
- 采用正交基分解(如傅里叶基)表示DNN输出,并追踪训练过程中各频率系数的演化过程。
- 通过一维分类任务(使用交叉熵损失)进行实证验证,表明低频分量在训练初期即被优先学习,而高频分量则滞后。
- 将DNN应用于通过狄利克雷原理求解一维泊松方程,从频率域角度比较DNN训练动力学与经典雅可比法和高斯-赛德尔法的收敛行为。
- 设计一种混合D-Jacobi方法:首先训练DNN以捕捉低频分量,随后将DNN输出作为经典迭代求解器的初始猜测,用于高频分量的精细化修正。
- 实现基于损失平坦度与波动性的自适应切换机制,以避免过早或过晚从DNN切换至经典求解器。
实验结果
研究问题
- RQ1当使用均方误差之外的一般损失函数(如交叉熵)时,频率原则是否依然成立?
- RQ2DNN中的F-Principle能否被用于加速经典迭代方法中低频收敛缓慢的微分方程求解?
- RQ3如何将DNN固有的频率偏差与经典求解器相结合,以提升整体收敛速度与精度?
- RQ4在混合数值格式中,最优切换时机应如何确定,即何时从DNN训练切换至经典迭代求解器?
- RQ5DNN的频率偏差在多大程度上与雅可比法或高斯-赛德尔法等经典求解器的收敛行为相匹配?
主要发现
- F-Principle在一般损失函数下依然成立,包括交叉熵和均方误差,该结论通过理论分析与实验得到验证。
- 在一维分类任务中使用交叉熵损失时,DNN仍优先学习低频分量,进一步证实了F-Principle的普适性。
- 在求解泊松方程时,DNN在低频分量上的收敛速度优于雅可比法,后者在低频区域收敛缓慢。
- 当在损失平坦度时刻切换至经典求解器时,D-Jacobi混合方法的收敛速度优于单独使用DNN或雅可比法。
- 在最优切换点,DNN输出的无穷范数误差低于经过长时间训练的DNN单独结果,表明其效率更高。
- 频域分析表明,DNN在训练初期即抑制高频分量,从而避免了多项式拟合中常见的振荡现象(如龙格现象)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。