Skip to main content
QUICK REVIEW

[论文解读] Sanity Checks for Lottery Tickets: Does Your Winning Ticket Really Win the Jackpot?

Xiaolong Ma, Geng Yuan|arXiv (Cornell University)|Jun 30, 2021
Gambling Behavior and Treatments被引用 15
一句话总结

本文通过提出一种更严格的'赢家彩票'定义,重新审视了彩票猜想,该定义考虑了训练配方的质量,包括初始学习率、训练轮数和网络结构因素。通过在多种深度神经网络架构上进行广泛实验,发现赢家彩票对超参数和残差连接极为敏感,并提出了实用的识别指南。研究揭示,当前方法在严格标准下往往失败,但在稍作放宽的条件下则能成功。

ABSTRACT

There have been long-standing controversies and inconsistencies over the experiment setup and criteria for identifying the "winning ticket" in literature. To reconcile such, we revisit the definition of lottery ticket hypothesis, with comprehensive and more rigorous conditions. Under our new definition, we show concrete evidence to clarify whether the winning ticket exists across the major DNN architectures and/or applications. Through extensive experiments, we perform quantitative analysis on the correlations between winning tickets and various experimental factors, and empirically study the patterns of our observations. We find that the key training hyperparameters, such as learning rate and training epochs, as well as the architecture characteristics such as capacities and residual connections, are all highly correlated with whether and when the winning tickets can be identified. Based on our analysis, we summarize a guideline for parameter settings in regards of specific architecture characteristics, which we hope to catalyze the research progress on the topic of lottery ticket hypothesis. Our codes are publicly available at: https://github.com/boone891214/sanity-check-LTH.

研究动机与目标

  • 解决由于实验设置不一致以及对'赢家彩票'识别标准不明确,导致彩票猜想研究长期存在的争议。
  • 基于训练配方质量、网络架构和稀疏度,定义更严格的'大奖'赢家彩票标准。
  • 通过实证研究,分析学习率、训练轮数、残差连接和网络容量等关键因素对赢家彩票出现的影响。
  • 为研究人员开发一套实用的、基于数据的指南,以在多种深度神经网络架构和数据集上可靠地识别赢家彩票。
  • 澄清在严格条件下赢家彩票是否真正存在,并评估现有方法(如IMP和OMP)的有效性。

提出的方法

  • 提出一种更严格的彩票猜想定义,明确包含训练配方参数(如初始学习率、训练轮数)和性能比较标准。
  • 在多种深度神经网络架构(如ResNet-20、VGG-19)和数据集(如CIFAR-10)上,通过改变超参数和稀疏度水平,进行广泛的消融实验。
  • 采用迭代剪枝(IMP)和一次性剪枝(OMP)方法,评估不同初始化和训练条件下子网络的性能。
  • 定量分析赢家彩票成功与否与学习率、残差连接和网络深度等因素的相关性。
  • 通过不同学习率进行预训练,并以不同学习率微调子网络,评估其稳定性和性能增益。
  • 基于实证规律,开发系统性指南,推荐针对不同网络特性的最优超参数。

实验结果

研究问题

  • RQ1什么样的严格定义能解决先前彩票猜想研究中的一致性问题?
  • RQ2在该严格定义下,赢家彩票是否真正存在于主流深度神经网络架构中?
  • RQ3关键训练超参数(尤其是学习率和训练轮数)如何影响赢家彩票的识别?
  • RQ4残差连接等网络结构组件以及网络容量在赢家彩票出现过程中起到什么作用?
  • RQ5在何种条件下OMP足以替代IMP?何时需要彩票初始化?

主要发现

  • 在所提出的严格定义下,使用现有方法未发现任何'真正'的赢家彩票,表明先前的结论可能基于次优的训练配方。
  • 当存在残差连接时,使用较小的学习率(如0.01)可显著提高识别(接近)赢家彩票的可能性。
  • 在无残差连接的网络中,OMP的性能可与IMP相媲美,表明此类情况下IMP并非必需。
  • 在较高学习率(如0.1)下,彩票初始化子网络的性能下降,不再优于随机重初始化,与原始彩票猜想的主张相矛盾。
  • 使用较高学习率(0.1,达到92.4%准确率)进行预训练,其子网络性能(通过OMP达到87.4%)优于使用0.01预训练,表明预训练阶段学习率的选择至关重要。
  • 子网络训练阶段的学习率选择也显著影响性能:例如,在91.4%稀疏度下,对ResNet-20使用0.005进行子网络训练可达到89.7%的IMP准确率,优于使用0.01(89.4%)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。