[论文解读] Smallify: Learning Network Size while Training
Smallify 提出了一种新颖的训练时技术,通过使用可学习的 SwitchLayer 动态剪枝不重要的神经元,联合优化神经网络大小、推理速度和准确率。与标准训练相比,该方法可将模型缩小最多 35 倍,推理速度提升 6 倍,且准确率损失极小。
As neural networks become widely deployed in different applications and on different hardware, it has become increasingly important to optimize inference time and model size along with model accuracy. Most current techniques optimize model size, model accuracy and inference time in different stages, resulting in suboptimal results and computational inefficiency. In this work, we propose a new technique called Smallify that optimizes all three of these metrics at the same time. Specifically we present a new method to simultaneously optimize network size and model performance by neuron-level pruning during training. Neuron-level pruning not only produces much smaller networks but also produces dense weight matrices that are amenable to efficient inference. By applying our technique to convolutional as well as fully connected models, we show that Smallify can reduce network size by 35X with a 6X improvement in inference time with similar accuracy as models found by traditional training techniques.
研究动机与目标
- 解决因独立优化模型大小、推理速度和准确率而造成的次优权衡问题。
- 克服后训练压缩技术的局限性,后者由于稀疏矩阵运算导致推理速度下降。
- 在单个训练过程中实现网络架构、准确率和效率的端到端联合优化。
- 从一开始就探索更小但高性能的网络架构,而非在训练后对大模型进行压缩。
提出的方法
- 引入一种 SwitchLayer,可在训练过程中学习开启或关闭神经元,从而实现动态网络大小调整。
- 使用可微分的门控机制,联合优化神经元重要性和模型性能。
- 通过学习神经元的二值掩码(开启/关闭)实现神经元级别的剪枝,剪枝后得到密集的权重矩阵。
- 采用组 LASSO 正则化的松弛形式,以鼓励稀疏的神经元激活模式。
- 在推理前移除 SwitchLayers,确保无运行时开销。
- 将网络大小视为单一超参数,简化架构搜索过程。
实验结果
研究问题
- RQ1是否可以在训练过程中联合优化网络大小、模型准确率和推理效率,而非在后处理阶段进行?
- RQ2与标准训练和后压缩方法相比,训练期间的动态神经元剪枝是否能生成更小、更快且更准确的模型?
- RQ3剪枝后的模型是否能保持密集的权重矩阵,以确保在 GPU 上实现高效推理?
- RQ4与现有压缩技术相比,该方法在模型大小、速度和准确率方面表现如何?
- RQ5该方法与组 LASSO 正则化之间存在何种理论关系?
主要发现
- 与标准训练相比,Smallify 在 CIFAR-10 上将模型大小减少最多 35 倍,推理速度提升最多 6 倍,准确率仅下降 1%。
- 在 CIFAR-10 上,Smallify 实现了与标准训练模型相同的准确率,同时将网络大小减少了 2.2 倍。
- 该方法在剪枝后生成密集的权重矩阵,可确保在 GPU 上高效推理,这与传统剪枝产生的稀疏模型形成鲜明对比。
- 所提出的方法在理论上等价于一种松弛的组 LASSO 形式,由于参数的符号对称性,存在多个全局最小值。
- SwitchLayers 可在推理前安全移除,不会引入任何运行时开销。
- 该方法使研究者能够从一开始就探索更小但高性能的网络架构,避免了后处理压缩的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。