[论文解读] Towards Understanding Iterative Magnitude Pruning: Why Lottery Tickets Win
本文表明,通过使用大批次训练,大型视觉模型能够从初始化状态实现彩票剪枝,该方法稳定了训练过程并实现了线性模式连通性。研究为再生彩票解释(RTI)提供了强有力的实证支持,表明迭代剪枝在各轮剪枝中会重新训练至相似的极小值点,暗示彩票剪枝依赖于先前的密集训练,无法通过与数据无关的初始化找到。
The lottery ticket hypothesis states that sparse subnetworks exist in randomly initialized dense networks that can be trained to the same accuracy as the dense network they reside in. However, the subsequent work has failed to replicate this on large-scale models and required rewinding to an early stable state instead of initialization. We show that by using a training method that is stable with respect to linear mode connectivity, large networks can also be entirely rewound to initialization. Our subsequent experiments on common vision tasks give strong credence to the hypothesis in Evci et al. (2020b) that lottery tickets simply retrain to the same regions (although not necessarily to the same basin). These results imply that existing lottery tickets could not have been found without the preceding dense training by iterative magnitude pruning, raising doubts about the use of the lottery ticket hypothesis.
研究动机与目标
- 探究是否可以在不回溯至早期训练状态的情况下,在大型视觉模型中发现彩票剪枝。
- 检验再生彩票解释(RTI),该解释认为彩票剪枝在各轮剪枝中会重新训练至相似的极小值点。
- 确定IMP的成功是否源于重新训练至相同的解区域,而不仅仅是随机初始化。
- 评估训练稳定性与线性模式连通性在实现彩票剪枝发现中的作用。
- 通过分析彩票剪枝对先前密集训练的依赖性,评估与数据无关剪枝的可行性。
提出的方法
- 通过大批次随机梯度下降稳定训练,实现在无需回溯情况下的线性模式连通性。
- 使用迭代剪枝(IMP),在每轮剪枝后将权重重置为初始值。
- 修改损失函数以排斥先前找到的极小值点,以检验IMP对RTI的因果依赖性。
- 通过测量各轮剪枝间权重向量之间的夹角距离,量化解的相似性。
- 评估不同训练轨迹所得解之间的线性模式连通性,以评估训练稳定性。
- 比较使用与不使用排斥损失的IMP性能,以隔离解相似性在剪枝成功中的作用。
实验结果
研究问题
- RQ1是否可以在不回溯至早期训练状态的情况下,在大型视觉模型中发现彩票剪枝?
- RQ2根据再生彩票解释(RTI),迭代剪枝是否通过在各轮剪枝中重新训练至相似的极小值点而成功?
- RQ3训练稳定性(通过线性模式连通性衡量)如何影响发现彩票剪枝的能力?
- RQ4剪枝稀疏度与各轮剪枝间解的相似性之间存在何种关系?
- RQ5彩票剪枝是否可以通过与数据无关的初始化发现,还是先前的密集训练是必不可少的?
主要发现
- 大批次训练足够稳定,使得大型视觉模型能够从初始化状态发现彩票剪枝,从而消除了回溯至早期训练状态的需要。
- 再生彩票解释(RTI)得到强有力支持:IMP在各轮剪枝中会重新训练至相似的解区域,尤其在中等稀疏度下表现明显。
- 当损失函数被修改以排斥先前找到的极小值点时,IMP将失去发现彩票剪枝的能力,而随机重初始化则不受影响。
- 在稳定训练下,各轮剪枝间权重向量的夹角距离始终较小,表明解的相似性很强。
- 在极低和极高稀疏度下,解不一定会位于同一损失盆地,表明RTI在中等稀疏度下更为显著。
- 结果表明,与数据无关的剪枝方法可能难以成功,因为彩票剪枝依赖于对密集模型解的先验知识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。