[论文解读] Learning Activation Functions for Sparse Neural Networks
该论文提出SAFS,一种新颖的两阶段AutoML框架,可联合优化稀疏神经网络(SNNs)的激活函数与超参数,在高稀疏度下显著提升准确率。通过分别学习逐层激活函数并微调超参数,SAFS在MNIST、CIFAR-10和ImageNet-16数据集上的LeNet-5、VGG-16和ResNet-18模型上,相较于默认训练协议,准确率绝对提升最高达15.53%。
Sparse Neural Networks (SNNs) can potentially demonstrate similar performance to their dense counterparts while saving significant energy and memory at inference. However, the accuracy drop incurred by SNNs, especially at high pruning ratios, can be an issue in critical deployment conditions. While recent works mitigate this issue through sophisticated pruning techniques, we shift our focus to an overlooked factor: hyperparameters and activation functions. Our analyses have shown that the accuracy drop can additionally be attributed to (i) Using ReLU as the default choice for activation functions unanimously, and (ii) Fine-tuning SNNs with the same hyperparameters as dense counterparts. Thus, we focus on learning a novel way to tune activation functions for sparse networks and combining these with a separate hyperparameter optimization (HPO) regime for sparse networks. By conducting experiments on popular DNN models (LeNet-5, VGG-16, ResNet-18, and EfficientNet-B0) trained on MNIST, CIFAR-10, and ImageNet-16 datasets, we show that the novel combination of these two approaches, dubbed Sparse Activation Function Search, short: SAFS, results in up to 15.53%, 8.88%, and 6.33% absolute improvement in the accuracy for LeNet-5, VGG-16, and ResNet-18 over the default training protocols, especially at high pruning ratios. Our code can be found at https://github.com/automl/SAFS
研究动机与目标
- 解决在高剪枝率下激活函数与超参数对稀疏神经网络(SNNs)准确率下降影响的研究不足问题。
- 探究为何ReLU作为默认激活函数可能因梯度流动问题而阻碍SNN训练。
- 开发一种高效、自动化的SNN方法,联合优化激活函数与超参数,区别于密集网络的训练协议。
- 证明通过偏离标准训练实践,可显著提升SNN的准确率,尤其在高稀疏度场景下。
- 提出一种可扩展、与架构无关的框架,可应用于任意SNN而无需修改剪枝过程。
提出的方法
- 提出两阶段优化流程:首先,使用受DARTS启发的可微架构搜索(differentiable architecture search)控制器,通过离散搜索为每层学习最优的单变量激活函数。
- 其次,采用贝叶斯优化进行随机超参数优化(HPO),以微调学习率、权重衰减等与稀疏网络相关的训练超参数。
- 使用控制器网络在预定义的激活函数搜索空间中搜索,包括ReLU、LeakyReLU、Swish和HardSwish,其中包含可学习参数α和β。
- 在应用SAFS前,对稠密模型应用非结构化剪枝(unstructured magnitude pruning),确保该方法与剪枝算法无关。
- 使用学习到的激活函数与优化后的超参数训练SNN,并在MNIST、CIFAR-10和ImageNet-16等标准基准上进行评估。
- 将搜索过程与多目标优化目标相结合:在最大化验证准确率的同时,最小化搜索阶段的计算成本。

实验结果
研究问题
- RQ1在高剪枝率下,激活函数的选择(尤其是ReLU)对稀疏神经网络性能的退化程度如何?
- RQ2联合优化激活函数与超参数是否能将SNN的准确率提升至超过标准训练协议的水平?
- RQ3在SNN中,逐层激活函数搜索与在整个网络中使用单一全局激活函数相比,效果如何?
- RQ4SAFS带来的性能增益是否在不同架构(如LeNet-5、VGG-16、ResNet-18、EfficientNet-B0)和数据集(MNIST、CIFAR-10、ImageNet-16)上均具有可扩展性?
- RQ5所提出的方法是否可独立于剪枝算法应用,从而实现对现有SNN流程的广泛适用性?
主要发现
- 在99%剪枝率下,SAFS在MNIST数据集上的LeNet-5模型中,相较于使用ReLU的默认训练协议,准确率绝对提升达15.53%。
- 在CIFAR-10数据集上的VGG-16模型中,SAFS在99%剪枝率下准确率提升8.88%,显著优于标准ReLU训练协议。
- 在CIFAR-10数据集上的ResNet-18模型中,SAFS在99%稀疏度下实现6.33%的准确率绝对提升,证明其在深层网络中的有效性。
- 消融实验证实,SAFS的两个阶段——激活函数搜索与超参数调优——均独立贡献于性能提升,完整流程达到最高准确率。
- 该方法在多种架构与数据集上均表现出鲁棒性,EfficientNet-B0在ImageNet-16数据集上99%剪枝率下也实现了1.54%的准确率增益。
- 结果表明ReLU在SNN中并非最优选择,Swish与HardSwish在中层与深层网络中更为有效,而ReLU在浅层网络中表现更优。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。