Skip to main content
QUICK REVIEW

[论文解读] Gradient-only line searches: An Alternative to Probabilistic Line Searches

Dominic Kafka, Daniël N. Wilke|arXiv (Cornell University)|Mar 22, 2019
Robotics and Sensor-Based Localization参考文献 38被引用 11
一句话总结

该论文提出了一种仅使用梯度的不精确线搜索方法(GOLS-I),一种计算高效的自动确定随机神经网络训练中学习率的方法,无需使用代理模型或函数值估计。通过检测方向导数的符号变化以定位随机非负关联梯度投影点(SNN-GPPs),GOLS-I能够在15个数量级范围内自适应调整步长,并在大批次设置下优于概率线搜索(PrLS),实现了更优的训练稳定性和收敛性。

ABSTRACT

Step sizes in neural network training are largely determined using predetermined rules such as fixed learning rates and learning rate schedules. These require user input or expensive global optimization strategies to determine their functional form and associated hyperparameters. Line searches are capable of adaptively resolving learning rate schedules. However, due to discontinuities induced by mini-batch sub-sampling, they have largely fallen out of favour. Notwithstanding, probabilistic line searches, which use statistical surrogates over a limited spatial domain, have recently demonstrated viability in resolving learning rates for stochastic loss functions. This paper introduces an alternative paradigm, Gradient-Only Line Searches that are Inexact (GOLS-I), as an alternative strategy to automatically determine learning rates in stochastic loss functions over a range of 15 orders of magnitude without the use of surrogates. We show that GOLS-I is a competitive strategy to reliably determine step sizes, adding high value in terms of performance, while being easy to implement.

研究动机与目标

  • 为解决在随机神经网络训练中自动确定最优学习率的挑战,传统线搜索因小批量子采样引起的不连续性而失效。
  • 开发一种比概率线搜索(PrLS)更简单、更高效的替代方法,后者依赖高斯过程代理模型和方差估计。
  • 在现代深度学习中常见的动态小批量子采样(dynamic MBSS)场景下,实现稳健且自适应的步长选择。
  • 证明仅使用梯度信息——特别是方向导数的符号变化——可在不连续损失函数中有效定位极小值。
  • 提供一种实用且易于实现的PrLS替代方案,避免昂贵的代理建模,同时保持高性能。

提出的方法

  • GOLS-I通过在搜索方向上检测方向导数从负到正的符号变化,识别出随机非负关联梯度投影点(SNN-GPPs)。
  • 仅使用沿下降方向连续函数评估的梯度信息,避免了对函数值估计或代理模型的需求。
  • 该方法基于SNN-GPPs的位置,在15个数量级范围内动态调整步长,范围从α_min = 10⁻⁸到α_max = 10⁷。
  • 其在动态小批量子采样下运行,即每次梯度评估均重新采样新小批量,导致损失曲面出现不连续性。
  • 该算法设计为对采样噪声和不连续性具有鲁棒性,将方向导数的符号变化视为局部极小值的指示信号。
  • 它被实现为一种在不连续损失函数中的功能性线搜索,无需方差估计或概率建模。

实验结果

研究问题

  • RQ1仅使用梯度信息是否足以在由动态小批量子采样引起的随机不连续损失函数中确定有效的步长?
  • RQ2在多种深度学习问题中,GOLS-I与概率线搜索(PrLS)在收敛速度、稳定性和最终性能方面相比如何?
  • RQ3当应用于小批量与大批次大小时,GOLS-I是否保持鲁棒性和效率,特别是与PrLS相比?
  • RQ4GOLS-I是否能在不使用函数值估计或代理模型的情况下,可靠地在不连续损失景观中定位极小值?
  • RQ5GOLS-I是否是真实世界深度学习训练流水线中PrLS的可行且实用的替代方案?

主要发现

  • 在孤立的训练运行中,GOLS-I成功将损失降低至1×10⁻¹⁰,并实现了零训练分类误差,而PrLS在约1500次函数评估后表现出发散行为。
  • 对于小批量大小≥100的情况,GOLS-I在训练收敛速度和最终损失方面始终优于PrLS,展现出更优的自适应能力和步长选择性能。
  • 在小批量大小为|ℬₙ,ᵢ| = 10时,PrLS表现优于GOLS-I,特别是在MNIST和CIFAR10数据集上,这得益于其使用了额外的方差估计和更保守的步长控制。
  • 在所有测试的问题和架构中,GOLS-I的性能与手动调优的恒定学习率相比具有竞争力或更优。
  • 该方法无需代理建模、方差估计或函数值存储,因此在计算效率上更优,且比PrLS更容易集成到现有训练框架中。
  • GOLS-I在训练过程中展示了动态的步长重调节能力,能够适应损失函数特性在15个数量级范围内的变化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。