Skip to main content
QUICK REVIEW

[论文解读] Rare Gems: Finding Lottery Tickets at Initialization

Kartik K. Sreenivasan, Jy-yong Sohn|arXiv (Cornell University)|Feb 24, 2022
Stochastic Gradient Optimization Techniques被引用 10
一句话总结

本文提出 Gem-Miner 算法,可在网络初始化阶段发现彩票结构——即稀疏且可训练的子网络,在无需预热训练的情况下,于 CIFAR-10 和 ImageNet 上实现最先进准确率。Gem-Miner 通过迭代剪枝与微调,识别出‘稀有宝石’——即在初始化时即具备高准确率的子网络,其训练速度相比先前方法最快提升 19 倍,且超越所有已知基线方法。

ABSTRACT

Large neural networks can be pruned to a small fraction of their original size, with little loss in accuracy, by following a time-consuming "train, prune, re-train" approach. Frankle & Carbin conjecture that we can avoid this by training "lottery tickets", i.e., special sparse subnetworks found at initialization, that can be trained to high accuracy. However, a subsequent line of work by Frankle et al. and Su et al. presents concrete evidence that current algorithms for finding trainable networks at initialization, fail simple baseline comparisons, e.g., against training random sparse subnetworks. Finding lottery tickets that train to better accuracy compared to simple baselines remains an open problem. In this work, we resolve this open problem by proposing Gem-Miner which finds lottery tickets at initialization that beat current baselines. Gem-Miner finds lottery tickets trainable to accuracy competitive or better than Iterative Magnitude Pruning (IMP), and does so up to $19 imes$ faster.

研究动机与目标

  • 解决在初始化阶段发现彩票结构以超越简单基线方法及训练后剪枝方法的开放性问题。
  • 开发一种方法,可在无需预热训练的情况下,识别出可训练至 SOTA 准确率的稀疏子网络。
  • 确保所发现的子网络通过所有已知的合理性检验,包括随机稀疏子网络基线。
  • 在显著更少的训练周期内,实现与迭代剪枝(IMP)结合预热方法相当或更优的准确率。
  • 证明初始化时的高准确率是最终性能的强预测指标,从而实现更快、更高效的训练。

提出的方法

  • Gem-Miner 通过识别在任何微调前即具备准确率的子网络,发现‘稀有宝石’——即在初始化时即具有非平凡准确率的稀疏子网络。
  • 利用基于权重大小和梯度信息的全局评分指标引导迭代剪枝,通过自适应阈值设定避免层崩溃。
  • 算法每 5 个周期执行一次迭代剪枝,逐步将稀疏度降低至目标水平,同时保持高初始准确率。
  • 在评分向量上引入正则化项,以鼓励稀疏性并提升剪枝过程中的稳定性。
  • 通过可学习参数 λ 动态调整剪枝阈值,防止整层被完全剪除。
  • Gem-Miner 的设计旨在超越 EP 和 SR 等现有方法,通过结合全局剪枝、渐进式稀疏度降低与评分正则化实现性能突破。

实验结果

研究问题

  • RQ1能否在初始化阶段发现彩票结构,使其准确率与使用预热的训练后剪枝方法(如 IMP)相当?
  • RQ2在初始化时即具备高准确率的子网络(即‘稀有宝石’)是否能带来优于随机稀疏子网络的最终性能?
  • RQ3能否设计一种初始化阶段的剪枝方法,超越所有已知基线,包括随机稀疏子网络和逐层稀疏度启发式方法?
  • RQ4对现有初始化阶段剪枝方法(如 EP)需进行哪些修改,才能在初始化和微调后均实现高准确率?
  • RQ5延长 Gem-Miner 的训练时间是否能进一步提升性能?是否可缩小与训练后剪枝方法之间的差距?

主要发现

  • Gem-Miner 在 ResNet-20 上以 0.59% 稀疏度在 CIFAR-10 上实现 66.15% 的测试准确率,优于最佳 EP 变体(63.72%)及所有先前基线方法。
  • 在 CIFAR-10 上以 1.4% 稀疏度,Gem-Miner 经 150 个周期微调后达到 77.89% 的准确率,超越使用预热的 IMP(74.52%),并接近 Renda 等人提出的训练后剪枝方法(80.21%)。
  • 经过 3000 个周期训练的 Long Gem-Miner 达到 79.50% 的准确率,较标准 Gem-Miner 提升 1.5%,表明延长训练可进一步提升性能。
  • Gem-Miner 相比使用预热的 IMP 最快可实现 19 倍的训练加速,在显著更少的训练周期内达到相当或更优的准确率。
  • 该方法通过所有已知合理性检验:其性能优于随机稀疏子网络及其他基于启发式的基线方法,即使在逐层稀疏度被精心调优的情况下亦成立。
  • 消融实验确认,全局剪枝、渐进式稀疏度降低与评分正则化是关键组件——尤其是全局剪枝与渐进式剪枝——而正则化本身单独作用时收益甚微。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。