QUICK REVIEW
[论文解读] The Role of Permutation Invariance in Linear Mode Connectivity of Neural Networks
Rahim Entezari, Hanie Sedghi|arXiv (Cornell University)|Oct 12, 2021
Stochastic Gradient Optimization Techniques被引用 14
一句话总结
本文提出,神经网络中的排列不变性可消除SGD解之间线性插值的损失障碍,从而在考虑参数排列时实现线性模式连通性(LMC)。广泛的实验和对宽单隐藏层网络的理论分析支持该猜想,表明经排列后的解表现出接近零损失的障碍,对彩票票券、分布式训练和集成方法具有启示意义。
ABSTRACT
In this paper, we conjecture that if the permutation invariance of neural networks is taken into account, SGD solutions will likely have no barrier in the linear interpolation between them. Although it is a bold conjecture, we show how extensive empirical attempts fall short of refuting it. We further provide a preliminary theoretical result to support our conjecture. Our conjecture has implications for lottery ticket hypothesis, distributed training, and ensemble methods.
研究动机与目标
- 探究排列不变性是否能消除训练神经网络SGD解之间线性插值的损失障碍。
- 理解诸如权重排列等不变性如何影响损失景观的几何结构和模式连通性。
- 为该猜想提供理论和实证支持,即在排列不变性下,SGD解之间无损失障碍地线性连接。
- 探索其在彩票票券假说、分布式训练和集成方法中的实际启示。
提出的方法
- 提出一个猜想:当考虑排列不变性时,SGD解之间无损失障碍地线性连接。
- 使用模拟退火(SA)搜索网络权重的最优排列,以最小化两个训练模型之间的损失障碍。
- 在排列前后,通过线性插值评估成对训练网络之间的直接和间接障碍(例如,在MNIST、CIFAR-10上)。
- 在多种架构(MLP、CNN、VGG、ResNet)、数据集(MNIST、SVHN、CIFAR-10、CIFAR-100)、宽度和深度上进行广泛的实证评估。
- 理论分析证明,对于在随机初始化下宽的单隐藏层全连接网络,该猜想成立。
- 将真实SGD解与一个合成模型进行比较,其中解通过排列单个SGD解或初始化生成。
实验结果
研究问题
- RQ1在训练神经网络中,考虑排列不变性是否能消除SGD解之间线性插值的损失障碍?
- RQ2模拟退火在多大程度上能通过排列权重减少或消除两个训练网络之间的损失障碍?
- RQ3在应用排列后,障碍大小如何随网络宽度、深度和数据集复杂度变化?
- RQ4真实SGD解与一个通过排列生成解的合成模型之间,损失障碍是否存在一致关系?
- RQ5对于宽的单隐藏层网络,排列不变性下的线性模式连通性猜想能否在理论上得到证明?
主要发现
- 在超过3,000个训练网络上的广泛实证评估表明,应用最优排列后,SGD解之间的损失障碍持续降低,通常接近零。
- 对于宽的单隐藏层MLP,理论分析证实,在排列不变性下线性模式连通性成立,支持该猜想。
- 模拟退火在多种配置中成功找到能将两个网络间间接障碍降低至接近零的排列,包括在MNIST上宽度≥2^6、深度为1的MLP,以及在SVHN上宽度为2^10的浅层CNN。
- 对于简单任务(如MNIST、SVHN),测试集障碍大小随宽度和深度增加而显著减小;对于更复杂任务(如CIFAR-100),也观察到类似趋势,且障碍更小。
- 在不同架构和数据集上障碍降低的一致性表明,排列不变性显著简化了损失景观的几何结构。
- 合成模型(通过排列单个初始化生成解)与真实SGD解中观察到的障碍行为高度一致,支持该猜想的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。