[论文解读] Training Sparse Neural Networks
本文提出一种可微 gating 机制,通过学习二值 gate 变量动态剪枝参数,实现稀疏神经网络的端到端训练。通过在 gate 变量上使用双模正则化并以 0.5 为阈值进行剪枝,该方法在极小精度损失下实现最先进(SOTA)的模型压缩——在 AlexNet 上实现高达 10.3 倍的参数压缩,同时保持 69.04% 的 top-1 准确率。
Deep neural networks with lots of parameters are typically used for large-scale computer vision tasks such as image classification. This is a result of using dense matrix multiplications and convolutions. However, sparse computations are known to be much more efficient. In this work, we train and build neural networks which implicitly use sparse computations. We introduce additional gate variables to perform parameter selection and show that this is equivalent to using a spike-and-slab prior. We experimentally validate our method on both small and large networks and achieve state-of-the-art compression results for sparse neural network models.
研究动机与目标
- 开发一种在训练过程中诱导深度神经网络结构稀疏性的方法,减少参数量而不损失性能。
- 解决在非凸深度学习问题中,传统 L1/L2 正则化无法诱导有意义稀疏性的问题。
- 通过可微 gate 机制联合学习权重与剪枝决策,实现稀疏网络的端到端训练。
- 在 LeNet-5、AlexNet 和 VGG-16 等标准视觉基准上实现最先进(SOTA)的模型压缩比。
- 通过基于原始权重大小预初始化 gate 变量,确保对初始化的鲁棒性并实现高效微调。
提出的方法
- 引入可学习的 gate 变量 G,其为可微的,并解释为伯努利分布参数,使用二值采样 G^s 作为权重掩码。
- 在 gate 变量上使用双模正则化 w×(1−w),以促使取值聚集在 0 或 1 附近,从而促进稀疏性。
- 在 0.5 处应用阈值(最大似然采样),将实值 gate 转换为二值掩码,确保推理阶段的确定性。
- 将双模正则化与 gate 变量上的 L1 或 L2 正则化结合,以稳定训练并增强稀疏性。
- 采用联合优化目标:最小化 loss(ŷ(θ,Φ), y) + λ‖Φ‖,其中 Φ 是从 G^s 导出的索引集,惩罚总参数数量。
- 通过将 top-k% 的权重设为 g=1,其余设为 g=0.49 的方式预初始化 gate 变量,以在训练初期保留重要参数。
实验结果
研究问题
- RQ1可微且可学习的 gating 机制是否能有效在端到端训练中诱导深度神经网络的结构稀疏性?
- RQ2在非凸深度学习问题中,gate 变量上的双模正则化相较于标准 L1/L2 惩罚,在促进有意义稀疏性方面表现如何?
- RQ3基于权重大小预初始化 gate 变量对收敛速度和最终稀疏性-准确率权衡有何影响?
- RQ4该方法是否能在 AlexNet 和 VGG-16 等标准视觉架构上实现最先进(SOTA)的压缩比,同时保持高准确率?
- RQ5与现有剪枝与压缩技术相比,该方法在训练时间与压缩效率方面如何扩展?
主要发现
- 该方法在 AlexNet 上实现 10.3 倍压缩率(含索引共 9.8M 参数),top-1 准确率为 69.04%,优于先前方法。
- 在 VGG-16 上,该方法实现 14 倍压缩率,top-1 准确率为 69.04%,展现出在不同架构间的强大泛化能力。
- 对于 LeNet-5,该方法去除 96% 的参数,仅导致 0.24% 的准确率下降,实现最先进(SOTA)的压缩性能。
- 该方法将微调时间缩短至约 18 小时(AlexNet 上,对比先前工作的 173 小时),且仅需在单张 Titan X GPU 上训练 18 小时。
- 基于权重大小预初始化 gate 变量显著提升最终稀疏性与准确率,尤其在全连接层中实现 95% 稀疏性时效果更明显。
- 该方法对初始化具有鲁棒性,无论使用常数初始化还是随机初始化,均达到相似的稀疏水平,表明训练过程具有稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。