[论文解读] Logarithmic Pruning is All You Need
该论文表明,一个大规模、随机初始化的ReLU网络可以通过仅对数级过参数化(具体而言,每个目标权重为O(log(n_max/ε))个神经元),在不进行训练的情况下,包含一个能以高精度近似任意目标权重的子网络,从而证明剪枝足以实现强大性能,显著优于先前的多项式界。
The Lottery Ticket Hypothesis is a conjecture that every large neural network contains a subnetwork that, when trained in isolation, achieves comparable performance to the large network. An even stronger conjecture has been proven recently: Every sufficiently overparameterized network contains a subnetwork that, at random initialization, but without training, achieves comparable accuracy to the trained large network. This latter result, however, relies on a number of strong assumptions and guarantees a polynomial factor on the size of the large network compared to the target function. In this work, we remove the most limiting assumptions of this previous work while providing significantly tighter bounds:the overparameterized network only needs a logarithmic factor (in all variables but depth) number of neurons per weight of the target subnetwork.
研究动机与目标
- 建立更紧致的理论界,以确定大规模网络中包含一个无需训练即可近似目标网络的子网络所需的过参数化程度。
- 在不依赖强假设(如有界权重和输入范数)的前提下,将关键变量的缩放关系从多项式改进为对数级。
- 证明每个权重的对数级过参数化已足够实现高精度近似,支持剪枝是过参数化网络中学习核心机制的观点。
- 通过证明在随机初始化网络中存在‘胜出票’(winning tickets)的理论基础,为彩票猜想提供支持。
提出的方法
- 构建一个大规模全连接ReLU网络,其权重从双曲分布(1/v)中采样,以实现对目标权重的对数级近似。
- 采用黄金分割分解策略,将任意目标权重表示为来自几何间隔序列的少量采样权重之和。
- 应用概率论证,界定分解中每个区间至少包含一个采样权重的概率,从而确保高概率成功。
- 利用集中不等式证明:当m = O(k′ log(k′/δ))时,样本数已足够,其中k′ = log_{3/2}(3w_max/(2ε))为分解中的区间数。
- 证明:以高概率(1−δ),一个最多包含k′个活跃神经元的子网络可将任意目标权重在ε精度内近似。
- 利用1/v分布的尺度不变性,使结果可推广至不同权重幅度,而无需施加归一化约束。
实验结果
研究问题
- RQ1能否将寻找近似目标网络的子网络所需的过参数化程度,从目标网络规模的多项式级降低为对数级?
- RQ2在不假设权重或输入范数有界的情况下,随机初始化网络中‘胜出票’的存在性是否依然成立?
- RQ3每个目标权重的对数级神经元数量是否足以通过剪枝实现高精度近似?
- RQ4为使用子网络以ε精度将任意目标权重表示为若干采样权重之和,所需的最少采样权重数量是多少?
- RQ5权重采样分布的选择(如1/v与均匀分布)如何影响近似所需的过参数化程度?
主要发现
- 当权重和输入范数有界时,每个目标权重所需的神经元数量为Õ(log(n_max/ε)),相比先前的多项式界有显著改进。
- 在无有界范数假设下,每个权重所需的神经元数量为Õ(ℓ log(n_max/ε)),其中ℓ为网络层数,表明深度依赖性不可避免。
- 双曲权重分布(1/v)通过确保尺度不变性和对数区间内均匀覆盖,实现了对数级近似。
- 以高概率(1−δ),大小为Õ(log(1/ε) · log(1/δ))的子网络可仅通过少量活跃神经元,将任意目标权重在ε精度内近似。
- 该结果无需训练即可成立,表明‘胜出票’在随机初始化时即存在,且过参数化程度极低。
- 该理论框架支持一种猜想:随机梯度下降可能主要作为剪枝机制运行,从而揭示接近全局最优的子网络。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。