Skip to main content
QUICK REVIEW

[论文解读] The Impact of Reinitialization on Generalization in Convolutional Neural Networks

Ibrahim Alabdulmohsin, Hartmut Maennel|arXiv (Cornell University)|Sep 1, 2021
Advanced Neural Network Applications参考文献 46被引用 4
一句话总结

本文提出了一种新型的逐层重初始化方法(lw),用于卷积神经网络,通过依次重初始化较低层(同时保持权重范数并增强训练边界),显著提升了小样本数据集上的泛化性能。该方法通过促进更平坦的损失景观并鼓励早期层学习通用特征,优于以往的重初始化技术。

ABSTRACT

Recent results suggest that reinitializing a subset of the parameters of a neural network during training can improve generalization, particularly for small training sets. We study the impact of different reinitialization methods in several convolutional architectures across 12 benchmark image classification datasets, analyzing their potential gains and highlighting limitations. We also introduce a new layerwise reinitialization algorithm that outperforms previous methods and suggest explanations of the observed improved generalization. First, we show that layerwise reinitialization increases the margin on the training examples without increasing the norm of the weights, hence leading to an improvement in margin-based generalization bounds for neural networks. Second, we demonstrate that it settles in flatter local minima of the loss surface. Third, it encourages learning general rules and discourages memorization by placing emphasis on the lower layers of the neural network. Our takeaway message is that the accuracy of convolutional neural networks can be improved for small datasets using bottom-up layerwise reinitialization, where the number of reinitialized layers may vary depending on the available compute budget.

研究动机与目标

  • 探究在训练过程中对神经网络参数进行重初始化是否能提升泛化性能,特别是在低数据量场景下。
  • 比较各种重初始化策略(随机、基于大小、固定、全连接)在标准图像分类基准上的有效性。
  • 开发并评估一种新型重初始化方法——逐层(lw),该方法自下而上系统性地重初始化各层,并结合归一化处理。
  • 通过边界最大化、损失景观平坦性以及减少记忆化现象,解释泛化性能的提升机制。
  • 确定重初始化带来优势的条件,并根据计算资源约束指导实际部署。

提出的方法

  • 所提出的lw方法将CNN划分为K个卷积块,并按顺序从k=1到K依次重初始化最低的k个块。
  • 在每一阶段k,将前k个块的权重重新缩放至原始初始化的范数,同时对所有后续层进行重初始化。
  • 在第k个块后插入或更新一个归一化层(类似批量归一化),以稳定激活值并维持梯度流动。
  • 每个块重复此过程N次,每次重初始化后进行微调以实现收敛。
  • 该方法显式保持早期层权重的Frobenius范数,同时增加训练样本上的边界。
  • 在多种架构下,于12个图像分类数据集上评估该方法,并对归一化与重缩放组件进行消融研究。

实验结果

研究问题

  • RQ1与标准训练及其他重初始化方法相比,逐层重初始化是否能提升CNN的泛化性能?
  • RQ2重初始化如何影响训练样本上的边界值以及权重的范数?
  • RQ3重初始化在多大程度上使损失景观中的局部极小值变得更平坦?
  • RQ4重初始化是否减少记忆化现象,并促进早期层学习通用特征?
  • RQ5lw的性能如何随数据集规模和可用计算预算的变化而变化?

主要发现

  • 在12个基准数据集上,逐层重初始化(lw)方法始终优于基线训练及其他重初始化策略(welsr、dsd、wels、fc),尤其在小规模训练集上表现更优。
  • lw在不增加权重Frobenius范数的前提下,提升了训练样本的最小边界,从而改善了基于边界的泛化界。
  • 经实证验证,采用lw训练的最终模型位于损失景观中更平坦的区域,表现为在参数扰动下训练损失变化更小,相较于标准训练。
  • 消融研究证实,归一化与重缩放是lw的关键组件,其移除将导致性能下降。
  • lw通过强调早期层的学习(通常为通用特征学习区域),减少对数据集特异性模式的记忆化,从而抑制过拟合。
  • 在大规模数据集上,重初始化的优势减弱,表明其主要优势体现在低数据量下的泛化能力提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。