[论文解读] Avoiding Spurious Local Minima in Deep Quadratic Networks
本文证明,在过参数化条件下,深度二次神经网络在其损失曲面中可避免虚假局部极小值,且在温和条件下,梯度下降以概率1收敛至全局最小值。研究显示,通过添加输入范数作为回归器或使用结构化正则化,即使在仅含d个神经元的两层网络中,也能实现对虚假驻点的逃离,其中输入维度为d。
Despite their practical success, a theoretical understanding of the loss landscape of neural networks has proven challenging due to the high-dimensional, non-convex, and highly nonlinear structure of such models. In this paper, we characterize the training landscape of the mean squared error loss for neural networks with quadratic activation functions. We prove existence of spurious local minima and saddle points which can be escaped easily with probability one when the number of neurons is greater than or equal to the input dimension and the norm of the training samples is used as a regressor. We prove that deep overparameterized neural networks with quadratic activations benefit from similar nice landscape properties. Our theoretical results are independent of data distribution and fill the existing gap in theory for two-layer quadratic neural networks. Finally, we empirically demonstrate convergence to a global minimum for these problems.
研究动机与目标
- 理论刻画使用均方误差损失的深度二次神经网络的损失曲面。
- 通过证明当k ≥ d个神经元时,两层二次网络在任意数据分布下均可实现全局收敛,弥合现有理论的空白。
- 证明过参数化与特定正则化策略可消除虚假局部极小值与鞍点。
- 建立梯度下降在高维非凸设置下收敛至全局最小解的条件,即使在二次网络中亦成立。
提出的方法
- 分析具有ReLU类二次激活函数的两层及深层二次神经网络中的均方误差损失函数。
- 通过显式引入输入样本的L2范数作为回归器,实现数据归一化,以逃离虚假局部极小值。
- 通过在因子分解矩阵上施加Frobenius范数惩罚实现正则化,以强制实现满秩解,避免低秩陷阱。
- 利用特征值分解与张量分解理论,在满秩条件下将优化问题重述为权重空间中的凸问题。
- 采用任意步长的梯度下降,证明当网络过参数化且初始化得当时,可收敛至全局最小值。
- 通过证明当k = binom(d+p-1, d-1)个神经元且初始化得当时,全局收敛性在更高阶多项式网络(PL网络)中仍可保证,将结果推广至更高阶多项式网络。
实验结果
研究问题
- RQ1在何种条件下,两层二次神经网络可避免其损失曲面中的虚假局部极小值?
- RQ2当神经元数量低至输入维度d时,梯度下降是否仍可收敛至二次网络的全局最小值?
- RQ3具体而言,将输入范数作为回归器进行数据归一化,如何影响对虚假驻点的逃离?
- RQ4在二次网络的对称矩阵因子分解中,正则化在消除虚假解方面发挥何种作用?
- RQ5深度过参数化二次网络是否继承了其两层对应网络的有利优化性质?
主要发现
- 对于具有k ≥ d个神经元的两层二次网络,当使用输入范数作为回归器时,梯度下降以概率1逃离虚假局部极小值与鞍点。
- 理论结果独立于数据分布,消除了先前工作中存在的限制性假设。
- 过参数化的深层二次网络不包含虚假驻点,可通过梯度下降实现全局收敛。
- 当k = d时,训练问题退化为带有二次特征的最小二乘问题,可通过特征值分解求解。
- 对于更高阶多项式网络(p > 2),当k = binom(d+p-1, d-1)个神经元且初始化得当时,可保证全局收敛。
- 分析中使用的正则化惩罚可确保满秩因子分解,避免可能导致虚假极小值的低秩解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。