Skip to main content
QUICK REVIEW

[论文解读] Training Deep Networks without Learning Rates Through Coin Betting

Francesco Orabona, Tatiana Tommasi|arXiv (Cornell University)|May 22, 2017
Stochastic Gradient Optimization Techniques参考文献 29被引用 7
一句话总结

本文提出 COCOB(Continuous Coin Betting),一种用于训练深度神经网络的无初始学习率随机优化算法。通过将随机梯度下降重新表述为对硬币下注的游戏,COCOB 动态调整步长,无需手动调节学习率,其性能在多个基准测试(包括 CIFAR-10 和 PTB 语言建模)中与或优于当前最先进方法(如 Adam 和 Adagrad)。

ABSTRACT

Deep learning methods achieve state-of-the-art performance in many application scenarios. Yet, these methods require a significant amount of hyperparameters tuning in order to achieve the best results. In particular, tuning the learning rates in the stochastic optimization process is still one of the main bottlenecks. In this paper, we propose a new stochastic gradient descent procedure for deep networks that does not require any learning rate setting. Contrary to previous methods, we do not adapt the learning rates nor we make use of the assumed curvature of the objective function. Instead, we reduce the optimization process to a game of betting on a coin and propose a learning-rate-free optimal algorithm for this scenario. Theoretical convergence is proven for convex and quasi-convex functions and empirical evidence shows the advantage of our algorithm over popular stochastic gradient algorithms.

研究动机与目标

  • 解决深度学习中持续存在的超参数调优挑战,特别是随机梯度下降中手动选择学习率的问题。
  • 通过将优化过程重新定义为博弈论中的硬币下注问题,消除对学习率调度或自适应调整的需求。
  • 开发一种理论基础扎实、依赖数据的优化策略,实现凸函数和拟凸函数的最优收敛速率。
  • 证明无学习率方法可在真实世界深度学习任务中达到或超越主流自适应优化器的性能。
  • 为该算法的收敛性提供理论基础,并通过实证验证其在多种架构和数据集上的鲁棒性。

提出的方法

  • 将随机梯度下降重新表述为一种序列决策游戏——对硬币下注,目标是在时间上最大化累积财富。
  • 提出一种新颖的、依赖数据的下注策略,根据梯度大小动态调整步长,避免依赖曲率假设。
  • 将 COCOB 算法推导为硬币下注游戏的解,确保凸函数和拟凸函数的最优遗憾边界。
  • 通过将下注比例解释为参数空间中的更新幅度,将硬币下注框架映射回梯度下降。
  • 实现一种专为深度神经网络设计的 COCOB 变体,使用批量归一化和梯度裁剪以稳定训练。
  • 通过依赖相对梯度大小而非绝对值,确保尺度不变性和鲁棒性,从而消除对学习率超参数的需求。

实验结果

研究问题

  • RQ1能否通过博弈论原理将随机梯度下降重新表述为无学习率的优化过程?
  • RQ2一种依赖数据的硬币下注策略是否能在无需学习率调优的情况下,实现凸函数和拟凸函数的最优收敛速率?
  • RQ3所提出的 COCOB 算法在深度学习基准测试中的性能与当前最先进自适应优化器(如 Adam、Adagrad、AdaDelta)相比如何?
  • RQ4在真实世界深度学习任务中,学习率超参数的缺失在多大程度上影响泛化能力和测试性能?
  • RQ5硬币下注框架能否扩展至非凸深度学习目标,同时保持理论保证和实证有效性?

主要发现

  • 在 CIFAR-10 上,COCOB 的训练性能与 Adam、Adagrad 和 AdaDelta 相当或更优,测试误差差异仅约 0.008 的误差率。
  • 在 PTB 语言建模任务中,COCOB 在训练代价和泛化能力方面与 Adam 和 Adagrad 相当或更优,困惑度低于大多数竞争对手。
  • 该算法对过拟合表现出鲁棒性,COCOB 和 Adagrad 展现出最稳定的测试困惑度曲线,而其他方法在收敛后困惑度持续上升。
  • 实证结果表明,当学习率被精细调优时,主流优化器之间的性能差距缩小,表明其具有相似的内在行为。
  • 理论分析证明,COCOB 在凸函数和 τ-弱拟凸函数上可实现最优收敛速率,为其实际成功提供了坚实理论基础。
  • 学习率超参数的缺失并未影响性能,COCOB 在多种架构和数据集上均保持稳定性和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。