Skip to main content
QUICK REVIEW

[论文解读] Pruning Randomly Initialized Neural Networks with Iterative Randomization

Daiki Chijiwa, Shin’ya Yamaguchi|arXiv (Cornell University)|Jun 17, 2021
Advanced Neural Network Applications参考文献 30被引用 5
一句话总结

该论文提出 IteRand,一种通过迭代随机化剪枝权重来剪枝随机初始化神经网络的新方法,显著提升了参数效率。理论上,IteRand 将发现获胜彩票所需的网络宽度降低至全训练网络的常数倍以内——克服了先前工作中存在的对数宽度惩罚——同时在 CIFAR-10、ImageNet 和 IMDB 的仅剪枝设置中实现了最先进性能。

ABSTRACT

Pruning the weights of randomly initialized neural networks plays an important role in the context of lottery ticket hypothesis. Ramanujan et al. (2020) empirically showed that only pruning the weights can achieve remarkable performance instead of optimizing the weight values. However, to achieve the same level of performance as the weight optimization, the pruning approach requires more parameters in the networks before pruning and thus more memory space. To overcome this parameter inefficiency, we introduce a novel framework to prune randomly initialized neural networks with iteratively randomizing weight values (IteRand). Theoretically, we prove an approximation theorem in our framework, which indicates that the randomizing operations are provably effective to reduce the required number of the parameters. We also empirically demonstrate the parameter efficiency in multiple experiments on CIFAR-10 and ImageNet. The code is available at: https://github.com/dchiji-ntt/iterand

研究动机与目标

  • 解决权重剪枝优化中的参数低效问题,该问题要求剪枝方法使用的网络宽度远大于权重优化方法才能达到相近准确率。
  • 通过克服 Pensia 等人(2020)提出的工作中发现的对数宽度惩罚,该工作表明仅剪枝方法需要比训练方法更宽的网络。
  • 开发一种方法,在不增加内存使用的情况下提升仅剪枝优化的有效性。
  • 证明迭代随机化可显式降低获胜彩票发现所需的网络宽度。
  • 在多种架构和数据集(包括视觉和 NLP 任务)上严格限制内存条件下验证该方法。

提出的方法

  • 引入迭代随机化:在每次剪枝步骤后,对剪枝连接的权重重新随机化,以在不增加额外内存的情况下模拟更宽的网络。
  • 维护一个二值掩码以追踪哪些权重处于激活状态,同时在每次迭代中将剪枝权重的值重置为新的随机值。
  • 使用可微分的基于分数的掩码优化(类似于 edge-popup)来识别重要权重,随后进行迭代剪枝与随机化。
  • 在多个训练周期中应用随机化过程,每个训练阶段固定随机化次数以保持稳定性。
  • 通过超参数 $K_{\text{per}}$ 和 $r$ 控制随机化的频率与幅度,确保收敛性和性能提升。
  • 将该方法集成到现有剪枝框架(如 OpenLTH)中,以实现与 IMP 和 edge-popup 的公平比较。

实验结果

研究问题

  • RQ1在仅剪枝优化中,迭代随机化能否将获胜彩票发现所需的网络宽度降低至全训练网络的常数倍以内?
  • RQ2在固定内存约束下,与 edge-popup 和 IMP 相比,迭代随机化是否能提升仅剪枝方法的准确率?
  • RQ3该方法在多种架构(如 VGG、ResNet、WideResNet、LSTM)和数据集(CIFAR-10、ImageNet、IMDB)上的表现如何?
  • RQ4IteRand 的性能增益是否对不同的稀疏度水平以及随机化频率和幅度等超参数具有鲁棒性?
  • RQ5迭代随机化的理论优势是否能在视觉和 NLP 任务中得到实证验证?

主要发现

  • IteRand 将获胜彩票发现所需的网络宽度降低至全训练网络的常数倍以内,克服了先前工作中存在的对数宽度惩罚。
  • 在 CIFAR-10 上,IteRand 在宽度因子 ρ=1.0 时使用 ResNet18 达到 92.47% 的准确率,而 edge-popup 需要 ρ=1.3 才能达到相同性能。
  • 在 ImageNet 上,IteRand 使用 WideResNet-50-2(68.8M 参数)实现 73.57% 的 top-1 准确率,优于相同参数预算下的 edge-popup(71.59%)。
  • 在 IMDB 文本分类任务中,IteRand 使用 LSTM 达到 88.44% 的准确率,使用 BiLSTM 达到 88.51%,均超过 edge-popup(88.16% 和 88.34%)和 SGD(87.39% 和 87.62%)。
  • 该方法在多种架构和任务中均表现有效,一致提升了准确率且未增加内存使用。
  • 迭代随机化过程使仅剪枝优化能够逼近如 IMP 等基于重训练方法的性能,即使在严格内存约束下亦如此。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。