Skip to main content
QUICK REVIEW

[論文レビュー] Gradient-only line searches: An Alternative to Probabilistic Line Searches

Dominic Kafka, Daniël N. Wilke|arXiv (Cornell University)|Mar 22, 2019
Robotics and Sensor-Based Localization参考文献 38被引用数 11
ひとこと要約

本稿では、補助モデルや関数値推定を用いず、確率的ニューラルネットワーク学習における学習率を自動的に決定する計算効率の高い手法である勾配のみの不正確ラインサーチ(GOLS-I)を提案する。方向微分の符号変化を検出することで、確率的非負の関連勾配射影点(SNN-GPP)を特定し、15桁のスケールにわたるステップサイズの適応を可能にし、大規模ミニバッチ設定において確率的ラインサーチ(PrLS)を上回る性能を発揮し、優れた学習安定性と収束性を達成する。

ABSTRACT

Step sizes in neural network training are largely determined using predetermined rules such as fixed learning rates and learning rate schedules. These require user input or expensive global optimization strategies to determine their functional form and associated hyperparameters. Line searches are capable of adaptively resolving learning rate schedules. However, due to discontinuities induced by mini-batch sub-sampling, they have largely fallen out of favour. Notwithstanding, probabilistic line searches, which use statistical surrogates over a limited spatial domain, have recently demonstrated viability in resolving learning rates for stochastic loss functions. This paper introduces an alternative paradigm, Gradient-Only Line Searches that are Inexact (GOLS-I), as an alternative strategy to automatically determine learning rates in stochastic loss functions over a range of 15 orders of magnitude without the use of surrogates. We show that GOLS-I is a competitive strategy to reliably determine step sizes, adding high value in terms of performance, while being easy to implement.

研究の動機と目的

  • ミニバッチサブサンプリングに起因する不連続性のため、従来のラインサーチが失敗する確率的ニューラルネットワーク学習における最適な学習率を自動的に決定する課題に対処すること。
  • ガウス過程の補助モデルや分散推定に依存する確率的ラインサーチ(PrLS)の代替として、より単純で効率的な手法を開発すること。
  • 現代のディープラーニングで一般的な動的ミニバッチサブサンプリング(dynamic MBSS)の状況において、頑健で適応的なステップサイズ選択を可能にすること。
  • 勾配情報のみ—特に方向微分の符号変化—が、不連続な損失関数においても最小値を効果的に特定できることを示すこと。
  • 高コストな補助モデル構築を回避しながらも、高い性能を維持する、実用的で実装が容易なPrLSの代替手段を提供すること。

提案手法

  • GOLS-Iは、探索方向に沿った方向微分の符号変化(負から正に変化)を検出することで、確率的非負の関連勾配射影点(SNN-GPP)を特定する。
  • 関数値推定や補助モデルを必要とせず、降下方向に沿った連続的な関数評価からの勾配情報のみを用いる。
  • SNN-GPPの位置に基づき、ステップサイズをα_min = 10⁻⁸からα_max = 10⁷にまで15桁のスケールで動的に調整する。
  • 各勾配評価ごとに新しいミニバッチが再サンプリングされる動的ミニバッチサブサンプリングの下で動作する。このため、損失関数に不連続性が生じる。
  • アルゴリズムはサンプリングノイズや不連続性に対して頑健であり、方向微分の符号変化を局所的最小値の指標として扱う。
  • 分散推定や確率的モデリングを一切必要としない、不連続損失関数における関数的ラインサーチとして実装される。

実験結果

リサーチクエスチョン

  • RQ1動的ミニバッチサブサンプリングに起因する確率的で不連続な損失関数において、勾配情報のみで効果的なステップサイズを決定できるか?
  • RQ2GOLS-Iは、多様なディープラーニング問題において、収束速度、安定性、最終的性能の観点で確率的ラインサーチ(PrLS)と比較してどのように異なるか?
  • RQ3GOLS-Iは、小規模なミニバッチサイズ(|ℬₙ,ᵢ| = 10)と大規模なミニバッチサイズの両方において、PrLSと比較して頑健性と効率性を維持できるか?
  • RQ4関数値推定や補助モデルを一切使用せずに、GOLS-Iが不連続な損失関数の最小値を信頼性高く特定できるか?
  • RQ5GOLS-Iは、実世界のディープラーニング学習パイプラインにおいて、PrLSの実用的で実現可能な代替手段として有効か?

主な発見

  • GOLS-Iは孤立した学習実行において損失を1×10⁻¹⁰まで低下させ、訓練分類誤差をゼロにまでにした。一方、PrLSは約1500回の関数評価後に発散する挙動を示した。
  • ミニバッチサイズが100以上の場合、GOLS-Iは収束速度および最終損失の観点でPrLSを一貫して上回り、優れた適応性とステップサイズ選択能力を示した。
  • 小規模なミニバッチサイズ(|ℬₙ,ᵢ| = 10)では、特にMNISTおよびCIFAR10において、PrLSがGOLS-Iを上回った。これは、PrLSが追加の分散推定と保守的なステップサイズ制御を用いているためである。
  • GOLS-Iは、全テスト問題およびアーキテクチャにおいて、手動でチューニングされた定数学習率と比較して、競争力のあるまたは優れた性能を発揮した。
  • GOLS-Iは補助モデル構築、分散推定、関数値の保存を一切不要としており、PrLSよりも計算効率が高く、既存の学習フレームワークへの統合が容易である。
  • GOLS-Iは、学習全体を通じてステップサイズを動的に再調整し、損失関数の特性の変化に15桁のスケールで適応した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。