[论文解读] GradMax: Growing Neural Networks using Gradient Information
GradMax 提出了一种通过最大化梯度范数来初始化新神经元以增长神经网络的方法,利用奇异值分解(SVD)实现最优初始化。该方法在不重新训练的情况下改善了训练动态,从而在视觉任务中实现更快的收敛速度,同时保持了已学习的表征。
The architecture and the parameters of neural networks are often optimized independently, which requires costly retraining of the parameters whenever the architecture is modified. In this work we instead focus on growing the architecture without requiring costly retraining. We present a method that adds new neurons during training without impacting what is already learned, while improving the training dynamics. We achieve the latter by maximizing the gradients of the new weights and find the optimal initialization efficiently by means of the singular value decomposition (SVD). We call this technique Gradient Maximizing Growth (GradMax) and demonstrate its effectiveness in variety of vision tasks and architectures.
研究动机与目标
- 为解决修改神经网络架构时重新训练效率低下的问题。
- 通过关注梯度大小而非即时损失减少,改善增量网络增长过程中的训练动态。
- 开发一种闭式方法,用于初始化新神经元以最大化其梯度贡献。
- 实现在不降低性能或无需大初始模型的情况下进行架构扩展。
- 提供一种可扩展、高效的现有神经架构搜索或剪枝方法的替代方案。
提出的方法
- GradMax 使用全批量梯度矩阵的 SVD 分解中前 k 个左奇异向量来初始化新神经元。
- 该方法通过将新神经元权重设置为最大化梯度范数,确保网络输出在增长前后保持不变。
- 它将初始化问题表述为最大化关于新权重的梯度范数,该问题可通过 SVD 得到闭式解。
- 该方法在训练过程中应用,新神经元按固定间隔或预设时间表添加。
- 通过确保初始化时网络输出不变,该方法保留了现有表征。
- 该方法适用于全连接层和卷积层,支持宽度增长或新增层。
实验结果
研究问题
- RQ1我们能否在不重新训练的情况下实现神经网络增长,同时改善训练动态?
- RQ2在初始化时最大化梯度范数是否能带来更快的收敛速度?
- RQ3能否使用 SVD 以闭式形式找到新神经元的最优初始化?
- RQ4与随机初始化或基于损失减少的初始化策略相比,GradMax 在训练速度和泛化能力方面表现如何?
- RQ5该方法能否在多种架构和视觉任务中有效应用?
主要发现
- GradMax 在多个视觉任务(包括 ImageNet 和 CIFAR-10)中实现了更快的训练收敛速度,且在增长后无需重新训练。
- 该方法在增长前后保持了网络输出分布不变,从而保留了已学习的表征。
- 基于 SVD 的初始化能有效最大化新神经元的梯度范数,且该特性在整个训练过程中持续保持。
- 训练初期,全批量 SVD 与小批量 SVD 之间对齐度较高,验证了使用小批量近似方法的合理性。
- 与随机初始化或基于损失减少的基线方法相比,GradMax 在训练初期表现更优,尤其在早期训练阶段优势明显。
- 该方法在宽度和深度增长方面均有效,且可集成到更广泛的神经架构搜索流程中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。