Skip to main content
QUICK REVIEW

[论文解读] Backprop Evolution

Maximilian Alber, Irwan Bello|arXiv (Cornell University)|Aug 8, 2018
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

该论文提出一种进化搜索方法,通过将反向传播方程视为领域特定语言中原始函数的组合,自动发现新颖的反向传播更新规则。该方法在早期训练中表现优于标准反向传播,在20个周期后,大型模型的准确率最高提升15%,且在收敛时性能与标准方法相当。

ABSTRACT

The back-propagation algorithm is the cornerstone of deep learning. Despite its importance, few variations of the algorithm have been attempted. This work presents an approach to discover new variations of the back-propagation equation. We use a domain specific lan- guage to describe update equations as a list of primitive functions. An evolution-based method is used to discover new propagation rules that maximize the generalization per- formance after a few epochs of training. We find several update equations that can train faster with short training times than standard back-propagation, and perform similar as standard back-propagation at convergence.

研究动机与目标

  • 自动发现可提升深度学习中泛化性能的改进反向传播更新规则。
  • 解决尽管反向传播在训练神经网络中具有基础性作用,但实际变体却很少的问题。
  • 探索在数学运算的领域特定语言上进行进化搜索,是否能获得优于标准反向传播的训练动态。
  • 评估所发现的规则是否能在不同模型架构和训练时长下泛化。
  • 识别出能在不牺牲最终性能的前提下加速收敛的更新规则,尤其适用于早停或超参数搜索场景。

提出的方法

  • 该方法使用领域特定语言(DSL)将反向传播更新方程表示为原始函数的组合:操作数(如权重、激活值、梯度)、一元函数(如转置、ReLU、Dropout)和二元函数(如加法、逐元素乘法)。
  • 一个进化控制器通过从预定义的函数和操作数集合中选择,生成并变异候选更新方程,形成误差梯度更新 $ b^{p}_i $ 的表达式。
  • 每个候选方程通过使用所提出的更新规则训练固定神经网络架构(如 WRN 16-2、WRN 10-1)进行评估,并在固定周期数后报告验证准确率。
  • 搜索过程以最大化早期训练后的泛化性能为目标,通过在不同模型尺寸和训练时长下测试结果,评估其鲁棒性和可迁移性。
  • 进化过程采用控制器-工作者架构:控制器向工作者批量发送变异后的方程,工作者训练模型并返回验证准确率,供选择和进一步变异。
  • 该方法同时评估标准SGD和带动量的SGD,并将结果与基线标准反向传播进行比较。

实验结果

研究问题

  • RQ1在领域特定语言上进行进化搜索,能否发现比标准反向传播在早期训练阶段泛化能力更强的反向传播更新规则?
  • RQ2所发现的更新规则是否能泛化到更大的神经网络架构,如同一模型的更深或更宽版本?
  • RQ3所发现的规则在收敛时是否保持性能,还是仅改善了早期训练动态?
  • RQ4在优化中引入动量,是否会影响所发现更新规则的鲁棒性?
  • RQ5所发现方程中是否存在一致的结构模式,可为未来设计更有效的反向传播变体提供指导?

主要发现

  • 进化搜索发现了在WRN 16-2上训练20个周期后,验证准确率优于标准反向传播的更新方程,SGD提升最高达1.2%,SGD带动量提升最高达0.8%。
  • 在更大的WRN 28-10模型上,最佳发现方程在SGD训练20个周期时,准确率比标准反向传播最高提升15%,带动量时提升10%。
  • 当训练100个周期时,所发现方程的性能与标准反向传播相当,表明其主要作用是加速早期收敛,而非提升最终泛化性能。
  • 表现最佳的方程在不同模型架构和训练制度下均表现出鲁棒性,表明可在搜索阶段有效使用较小模型。
  • SGD带动量的搜索结果与基线相当,表明动量可能降低了对更新规则选择的敏感性。
  • 特定方程如 $ (0.5g^{p}_{i}) / ( ext{softplus}( rac{ ext{d}h_{i}}{ ext{d}h^{p}_{i}}}) + 0.1) $ 达到87.72%准确率,而 $ (g^{p}_{i} imes ext{clip}_{1.0}(b^{p}_{i+1} rac{ ext{d}h^{p}_{i+1}}{ ext{d}h_{i}})) $ 达到88.93%准确率,两者在早期训练中均优于基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。