[论文解读] Campfire: Compressible, Regularization-Free, Structured Sparse Training for Hardware Accelerators
Campfire 提出了一种无需正则化的、面向卷积神经网络(CNNs)的结构化稀疏训练方法,通过在卷积核、特征图及组合粒度上使用固定的剪枝掩码,从训练初期即强制实现稀疏性。该方法在 ImageNet 上对 ResNet-50 实现了 70% 的稀疏度,且精度损失低于 1%,同时对 FGSM 对抗攻击保持了鲁棒性。
This paper studies structured sparse training of CNNs with a gradual pruning technique that leads to fixed, sparse weight matrices after a set number of epochs. We simplify the structure of the enforced sparsity so that it reduces overhead caused by regularization. The proposed training methodology Campfire explores pruning at granularities within a convolutional kernel and filter. We study various tradeoffs with respect to pruning duration, level of sparsity, and learning rate configuration. We show that our method creates a sparse version of ResNet-50 and ResNet-50 v1.5 on full ImageNet while remaining within a negligible <1% margin of accuracy loss. To ensure that this type of sparse training does not harm the robustness of the network, we also demonstrate how the network behaves in the presence of adversarial attacks. Our results show that with 70% target sparsity, over 75% top-1 accuracy is achievable.
研究动机与目标
- 解决稀疏训练中正则化带来的高计算与内存开销,尤其针对硬件加速器的场景。
- 在不牺牲模型精度或鲁棒性的前提下,实现 CNN 中的高稀疏度(60–70%)。
- 从训练初期即实现高效、固定结构的稀疏性,以支持硬件压缩与计算加速。
- 通过最小化不规则计算,确保结构化稀疏性与现有加速器架构的兼容性。
- 评估稀疏模型的对抗鲁棒性,以确保其在真实场景中的可行性,而不仅依赖于精度指标。
提出的方法
- 在训练初期的‘剪枝阶段’(20–30 个周期)应用基于大小的剪枝,永久固定稀疏权重掩码,供后续训练全程使用。
- 在三种粒度上强制实现结构化稀疏性:卷积核窗口内(R×S)、跨特征图(CK),以及组合配置。
- 消除正则化项(如基于范数的惩罚项),以降低计算开销,提升硬件效率。
- 早期固定稀疏模式,以确保一致的权重压缩,并使硬件能够跳过零值乘法运算。
- 在整个训练过程中使用固定的稀疏掩码,以维持稳定的参数预算并减少内存访问开销。
- 在剪枝前至少进行 20 个周期的密集训练,以保留模型容量并保障收敛精度。
实验结果
研究问题
- RQ1是否可以在不使用正则化的情况下,早期强制实现结构化稀疏性,从而降低硬件计算开销?
- RQ2在保持高精度的前提下,剪枝持续时间、稀疏度水平与学习率调度之间的最优权衡是什么?
- RQ3与密集模型相比,早期且固定的稀疏性对对抗鲁棒性有何影响?
- RQ4在 ImageNet 上,稀疏度可提升至多高(如 60–70%),同时保持最小的精度退化?
- RQ5固定且结构化的稀疏性是否能实现高效的硬件加速,而无需经历重新压缩或解压缩的开销?
主要发现
- Campfire 在 ImageNet 上对 ResNet-50 实现了 70% 的稀疏度,与密集基线相比,top-1 精度损失小于 1%。
- 该方法在 FGSM 对抗攻击下仍保持鲁棒性,稀疏模型在对抗条件下的表现与密集模型相当。
- 将剪枝延迟至至少第 20 个周期是实现高收敛精度的关键,凸显了早期密集训练的重要性。
- 剪枝后额外训练 10 个周期可带来约 1% 的精度增益,有效补偿稀疏性带来的性能损失。
- 所提出的窗口、CK 及组合稀疏方案因具备固定且结构化的稀疏模式,可实现高效的硬件映射。
- 无正则化训练减少了计算不规则性,支持能效更高、更适配加速器的推理与训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。