Skip to main content
QUICK REVIEW

[论文解读] On the Principle of Least Symmetry Breaking in Shallow ReLU Models

Yossi Arjevani, Michael Field|arXiv (Cornell University)|Dec 26, 2019
Stochastic Gradient Optimization Techniques参考文献 30被引用 5
一句话总结

本文提出了最小对称性破缺原理,用以解释浅层ReLU网络中随机梯度下降(SGD)为何收敛至具有高各向同性子群的临界点。研究发现,SGD检测到的虚假局部极小值相对于目标模型的对称性,表现出最大或较大的各向同性子群,从而为不同数据分布和激活函数下损失曲面中观察到的模式提供了理论解释。

ABSTRACT

We consider the optimization problem associated with fitting two-layer ReLU networks with respect to the squared loss, where labels are assumed to be generated by a target network. Focusing first on standard Gaussian inputs, we show that the structure of spurious local minima detected by stochastic gradient descent (SGD) is, in a well-defined sense, the \emph{least loss of symmetry} with respect to the target weights. A closer look at the analysis indicates that this principle of least symmetry breaking may apply to a broader range of settings. Motivated by this, we conduct a series of experiments which corroborate this hypothesis for different classes of non-isotropic non-product distributions, smooth activation functions and networks with a few layers.

研究动机与目标

  • 解释SGD在两层ReLU网络中发现的虚假局部极小值的结构模式。
  • 研究临界点的对称性是否由目标模型、数据分布与网络架构的联合不变性所决定。
  • 检验最小对称性破缺原理在各向同性高斯输入之外的普适性。
  • 探索该基于对称性的机制是否可推广至非各向同性分布、平滑激活函数(如Leaky-ReLU、Softplus)以及更深的网络。
  • 通过识别反例来确定该原理的适用边界,即在何种情况下对称性破缺不成立。

提出的方法

  • 分析两层ReLU网络中平方损失在权重矩阵行与列置换下的不变性结构。
  • 刻画对称群 $S_k \times S_d$ 与对角子群 $\Delta S_d$ 的各向同性子群格,以识别最大各向同性子群。
  • 将文献[16]中的自平衡特性重新表述为由连续对称性诱导的守恒律。
  • 通过SGD在不同输入分布(高斯分布、均匀分布、相关分布)、目标权重矩阵(单位矩阵、分块对角矩阵)和激活函数(ReLU、Leaky-ReLU、Softplus)下进行经验评估。
  • 将临界点的实际各向同性类型与目标模型对称群的理论最大各向同性子群进行比较。
  • 通过数值实验测试在分布偏移(如偏移后的均匀分布)和更深架构下的鲁棒性。

实验结果

研究问题

  • RQ1为何SGD在浅层ReLU网络中的轨迹始终收敛至具有高各向同性子群的临界点?
  • RQ2最小对称性破缺原理在非各向同性、非乘积型输入分布下在多大程度上成立?
  • RQ3临界点的各向同性类型如何随目标模型对称性的变化(如分块对角权重矩阵)而适应?
  • RQ4基于对称性的解释是否可推广至Leaky-ReLU和Softplus等平滑激活函数?
  • RQ5在何种条件下最小对称性破缺原理会失效,其结构特征是什么?

主要发现

  • 在具有高斯输入的两层ReLU网络中,SGD检测到的虚假局部极小值表现出的各向同性子群,在全局解的各向同性群 $\Delta S_d$ 内部为最大或较大。
  • 即使目标权重矩阵为分块对角矩阵(如 ${\bm{I}}_{d/2} \oplus 2{\bm{I}}_{d/2}$),临界点的结构仍与目标模型对称性的最大各向同性子群一致。
  • 对于非各向同性输入分布(如 $\mathcal{U}([-1+C,1+C]^{20})$),随着 $C$ 增大至1,临界点的各向同性逐渐减弱,表明对称性原理发生失效。
  • 在Leaky-ReLU和Softplus激活函数下,观察到相同的各向同性结构,尽管收敛速度通常慢于ReLU。
  • 在更深的全连接ReLU网络中,各向同性结构仅在低层保持,表明对称性在深度方向上传播有限。
  • 最小对称性破缺原理并非普遍成立:当输入分布破坏底层对称性时,该原理会失效,如在偏移均匀分布的案例中所证实。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。