[论文解读] The Effect of Network Width on Stochastic Gradient Descent and Generalization: an Empirical Study
本文研究了网络宽度如何影响随机梯度下降(SGD)的优化与泛化性能,提出了一种归一化噪声尺度,以考虑权重初始化和参数化的影响。研究发现,当该噪声尺度与宽度成正比时,可实现最优测试准确率,从而解释了为何更宽的网络泛化性能更好,以及为何在无批量归一化的情况下,最优小批量大小随宽度增加而减小。
We investigate how the final parameters found by stochastic gradient descent are influenced by over-parameterization. We generate families of models by increasing the number of channels in a base network, and then perform a large hyper-parameter search to study how the test error depends on learning rate, batch size, and network width. We find that the optimal SGD hyper-parameters are determined by a "normalized noise scale," which is a function of the batch size, learning rate, and initialization conditions. In the absence of batch normalization, the optimal normalized noise scale is directly proportional to width. Wider networks, with their higher optimal noise scale, also achieve higher test accuracy. These observations hold for MLPs, ConvNets, and ResNets, and for two different parameterization schemes ("Standard" and "NTK"). We observe a similar trend with batch normalization for ResNets. Surprisingly, since the largest stable learning rate is bounded, the largest batch size consistent with the optimal normalized noise scale decreases as the width increases.
研究动机与目标
- 理解网络宽度如何影响SGD的最优超参数设置及最终测试准确率。
- 探究SGD中的最优噪声尺度是否依赖于网络宽度,尤其是在无批量归一化的情况下。
- 评估经过权重初始化和参数化调整后的归一化噪声尺度,是否能跨不同架构预测最优训练性能。
- 探讨宽度对稳定学习率和最大小批量大小的影响,特别是在最优噪声条件下。
提出的方法
- 作者通过在基础网络中增加通道数,生成一系列模型家族,形成具有不同宽度的线性模型族。
- 在学习率、小批量大小和宽度上进行大规模超参数搜索,采用‘标准’和‘NTK’两种参数化方案。
- 关键指标为归一化噪声尺度,定义为 $ g = \frac{\epsilon N_{\text{train}}}{B \cdot \sigma^2} $,其中 $ \sigma $ 为初始化时的权重尺度。
- 比较不同宽度和超参数设置下的测试准确率,识别每种宽度下的最优超参数配置。
- 分析包含和不包含批量归一化的模型,重点关注MLP、卷积神经网络(ConvNets)和ResNets。
- 使用训练后期的平均测试准确率作为性能指标,验证归一化噪声尺度在不同架构和参数化方案下的鲁棒性。
实验结果
研究问题
- RQ1网络宽度如何影响SGD中用于泛化的最优超参数(学习率和小批量大小)?
- RQ2是否存在一个单一的归一化噪声尺度,可跨不同网络宽度预测最优测试准确率?
- RQ3最优噪声尺度与宽度的关系是否在不同架构(MLP、ConvNet、ResNet)和参数化方案中均成立?
- RQ4批量归一化如何影响宽度与最优噪声尺度之间的关系?
- RQ5数值稳定性对最大小批量大小施加了何种限制,尤其是在网络宽度增加时?
主要发现
- 在无批量归一化的情况下,最优归一化噪声尺度与网络宽度成正比,适用于MLP、ConvNets和ResNets。
- 更宽的网络能容忍并受益于更高的噪声尺度,从而实现更高的测试准确率。
- 最大稳定学习率受到限制,这导致与最优噪声尺度一致的最大小批量大小随宽度增加而减小。
- 无论采用NTK还是标准参数化,当学习率调整以保证稳定性时,最优小批量大小均与宽度成反比。
- 在批量归一化条件下,ResNets遵循与宽度成正比的噪声尺度趋势,但ConvNets不遵循,表明其行为具有架构和归一化依赖性。
- 研究结果表明,可能存在一个临界宽度,超过该宽度后,除非施加额外正则化,否则测试准确率将趋于饱和,原因在于可实现噪声尺度存在上限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。