Skip to main content
QUICK REVIEW

[论文解读] Understanding symmetries in deep networks

Vijay Badrinarayanan, Bamdev Mishra|arXiv (Cornell University)|Nov 3, 2015
Generative Adversarial Networks and Image Synthesis参考文献 21被引用 21
一句话总结

本文提出将卷积滤波器权重约束在单位范数流形上,以解决深度网络中阻碍标准SGD优化的复杂对称性问题。通过采用流形约束SGD强制执行单位范数约束,该方法在MNIST和SegNet上提升了测试准确率,同时保持计算效率,优于标准批量归一化和使用单位归一化初始化的基线SGD。

ABSTRACT

Recent works have highlighted scale invariance or symmetry present in the weight space of a typical deep network and the adverse effect it has on the Euclidean gradient based stochastic gradient descent optimization. In this work, we show that a commonly used deep network, which uses convolution, batch normalization, reLU, max-pooling, and sub-sampling pipeline, possess more complex forms of symmetry arising from scaling-based reparameterization of the network weights. We propose to tackle the issue of the weight space symmetry by constraining the filters to lie on the unit-norm manifold. Consequently, training the network boils down to using stochastic gradient descent updates on the unit-norm manifold. Our empirical evidence based on the MNIST dataset shows that the proposed updates improve the test performance beyond what is achieved with batch normalization and without sacrificing the computational efficiency of the weight updates.

研究动机与目标

  • 识别并分析现代深度网络中影响标准SGD优化的复杂权重空间对称性。
  • 解决批量归一化网络中由尺度不变性和参数重标定对称性引起的优化轨迹不稳定与可变性问题。
  • 提出一种计算高效的、对称性不变的优化方法,提升泛化能力,且不修改网络架构。
  • 证明单位范数权重约束可实现优于标准批量归一化和基线SGD(使用单位归一化权重)的测试性能。

提出的方法

  • 作者分析了一个包含卷积、批量归一化、ReLU、最大池化和Softmax的两层CNN架构(ArchBN),识别出滤波器进行对角缩放时存在的连续对称性。
  • 他们证明损失在重参数化 W̃₁ = αW₁ 和 W̃₂ = βW₂ 下保持不变,其中 α 和 β 为对角矩阵,这是由于批量归一化的单位方差特性所致。
  • 为解决此问题,他们提出将所有滤波器权重约束在单位范数流形上,将SGD转化为在黎曼流形上的优化。
  • 所提出的更新规则(表1)在每次更新后对单位范数流形进行投影,执行随机梯度下降,从而确保对称性不变。
  • 该方法使用Manopt在MATLAB中实现,并应用于MNIST和SegNet,未引入额外超参数(如权重衰减)。
  • 训练协议采用学习率衰减、早停策略以及基于验证集的学习率选择,以确保评估的稳健性。

实验结果

研究问题

  • RQ1在使用批量归一化、ReLU和最大池化的标准深度网络中,存在哪些类型的权重空间对称性?
  • RQ2这些对称性如何影响标准欧几里得SGD的收敛性和性能?
  • RQ3将滤波器权重约束在单位范数流形上,是否能提升泛化能力,同时保持计算效率?
  • RQ4所提出的对称性不变优化方法与标准批量归一化及基线SGD(使用单位归一化权重)相比表现如何?

主要发现

  • 在MNIST数据集上,所提出的单位范数(UN)更新在四层网络中实现了平均测试误差 0.0179 ± 0.0025,优于平衡SGD(B-SGD)的 0.0204 ± 0.0027。
  • 与B-SGD相比,单位范数方法降低了测试误差的方差,表明在多次运行中训练更加稳定。
  • 对于四层网络,UN更新在平均和方差上均达到最低的测试误差,证明其在更深架构中的优越性。
  • 该方法未引入额外超参数,有效起到了正则化作用。
  • 在语义分割任务中对SegNet的定性结果表明,使用所提更新方法可成功训练,表明其可扩展至更大规模网络。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。