Skip to main content
QUICK REVIEW

[论文解读] Greedy Optimization Provably Wins the Lottery: Logarithmic Number of Winning Tickets is Enough

Mao Ye, Lemeng Wu|arXiv (Cornell University)|Oct 29, 2020
Advanced Neural Network Applications被引用 7
一句话总结

该论文提出了一种基于贪心优化的网络剪枝方法,在适用于大多数实际深度网络的弱假设下,证明了其剪枝网络规模 $n$ 的误差衰减率可达指数级 $\mathcal{O}(\exp(-cn))$。与以往具有多项式误差率的方法不同,该方法在计算效率高且适用于深度、非过参数化架构的前提下,能显著更快地收敛至原始网络的性能。

ABSTRACT

Despite the great success of deep learning, recent works show that large deep neural networks are often highly redundant and can be significantly reduced in size. However, the theoretical question of how much we can prune a neural network given a specified tolerance of accuracy drop is still open. This paper provides one answer to this question by proposing a greedy optimization based pruning method. The proposed method has the guarantee that the discrepancy between the pruned network and the original network decays with exponentially fast rate w.r.t. the size of the pruned network, under weak assumptions that apply for most practical settings. Empirically, our method improves prior arts on pruning various network architectures including ResNet, MobilenetV2/V3 on ImageNet.

研究动机与目标

  • 为深度神经网络在保持精度的前提下可被剪枝的程度这一开放性理论问题提供解答。
  • 开发一种具有可证明理论保证的误差衰减率的剪枝方法,其性能优于现有方法。
  • 确保该方法在适用于真实世界深度网络的弱假设下仍有效,避免对过参数化的需求。
  • 提供一种实用且高效的算法,在ResNet、MobileNet和DGCNN等多样化架构上,性能优于先前的最先进剪枝方法。

提出的方法

  • 该方法采用类似Frank-Wolfe的贪心优化策略,迭代选择能最小化与原始网络激活分布距离的神经元。
  • 将剪枝问题形式化为神经元激活的凸包逼近问题,确保收敛至误差最小的子网络。
  • 基于神经元对层内平均激活向量的贡献,采用贪心前向选择策略进行神经元选择。
  • 利用神经元激活的凸包几何特性,通过利普希茨连续性来界定近似误差。
  • 该方法按层逐层应用,以构建保留原始网络功能行为的剪枝网络。
  • 引入实用的速度优化技术,在不牺牲理论保证的前提下提升计算效率。

实验结果

研究问题

  • RQ1我们能否在剪枝中实现比以往方法 $\mathcal{O}(n^{-1})$ 误差率更快的可证明误差衰减率?
  • RQ2是否可能在不依赖原始网络过参数化的情况下,实现指数级误差衰减($\mathcal{O}(\exp(-cn))$)?
  • RQ3在弱且现实的假设下,能否为深度网络剪枝提供贪心优化方法的理论依据?
  • RQ4在ResNet和MobileNet等多样化架构上,该方法与现有剪枝基线相比的实证表现如何?
  • RQ5在计算高效且精度损失最小的前提下,理论误差界是否能在实践中实现?

主要发现

  • 所提方法实现了 $\mathcal{O}(\exp(-cn))$ 的指数级误差衰减率,显著快于以往方法的 $\mathcal{O}(n^{-1})$ 或 $\mathcal{O}(n^{-2})$ 速率。
  • 理论误差界在弱假设下成立——无需过参数化——使其适用于大多数实际深度网络。
  • 实证结果表明,该方法在ImageNet和ModelNet40基准上,于ResNet-34、MobileNetV2/V3和DGCNN等架构上均优于先前最先进剪枝技术。
  • 该方法易于实现,并包含实用的速度优化技术,显著提升了时间效率,同时不损害性能。
  • 该算法能从完全训练的网络中成功识别出高性能子网络,证明了训练后可找到‘彩票’结构。
  • 理论分析证实,剪枝网络与原始网络之间的误差随剪枝网络规模呈指数级衰减。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。