Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic learning rate using Mutual Information

Shrihari Vasudevan|arXiv (Cornell University)|May 18, 2018
Stochastic Gradient Optimization Techniques参考文献 13被引用数 6
ひとこと要約

本稿では、深層ニューラルネットワークの学習中に、ネットワーク出力と真のラベルの間の相互情報量(MI)を用いて学習率を動的に調整する手法を提案する。MIの変化と入出力MI(入力-出力MI)という基準値に対する相対的値を追跡することで、固定スケジュールと比較して同等またはそれ以上の性能を、より少ない訓練時間で達成できる適応的学習率スケジューリングが可能になる。

ABSTRACT

This paper demonstrates dynamic hyper-parameter setting, for deep neural network training, using Mutual Information (MI). The specific hyper-parameter studied in this paper is the learning rate. MI between the output layer and true outcomes is used to dynamically set the learning rate of the network through the training cycle; the idea is also extended to layer-wise setting of learning rate. Two approaches are demonstrated - tracking relative change in mutual information and, additionally tracking its value relative to a reference measure. The paper does not attempt to recommend a specific learning rate policy. Experiments demonstrate that mutual information may be effectively used to dynamically set learning rate and achieve competitive to better outcomes in competitive to better time.

研究の動機と目的

  • 相互情報量(MI)が深層ニューラルネットワークにおける動的ハイパーパramータチューニングの信頼できる指標として機能するかどうかを調査すること。
  • 隠れ層の活性化と真のラベルの間のMIを用いて、適応的学習率スケジューリングを誘導する可能性を探ること。
  • MIに基づく学習率適応が、正確性と訓練時間の観点から、固定学習率ポリシーと同等またはそれを上回ることを評価すること。
  • MIを各層ごとの最適性指標として用いることで、層別学習率適応への拡張を試みること。
  • バッチサイズなどの他のハイパーパramータに動的な変化が生じた場合でも、本手法の頑健性を示すこと。

提案手法

  • 本手法は、各エポックごとに訓練データのランダムサブセットを用いて、KSG推定法により最終層の活性化と真のラベルの間の相互情報量(IHYLL)を計算する。
  • 連続するエポック間でのIHYLLの相対的変化に基づいて、動的学習率ポリシーを定義し、変化の大きさと方向に応じて学習率を増加または減少させる。
  • 拡張されたポリシーでは、IHYLLの相対的変化に加え、入力-出力MI(IXY)との正規化された値も組み込み、進行状況を基準値に基づいて測定する。
  • しきい値とスケーリング係数(γ1, γ2, γ3)を用いた区分的ルールにより学習率を更新し、データセットごとに個別に調整する。
  • MIの推定は、収束曲線に基づき、安定した推定が得られる1000の固定サンプルサイズを用いることで最適化されている。
  • MIの推定は、各層でのMI計算と個別の学習率調整の適用により、ネットワーク全体および層別での動的学習率スケジューリングをサポートする。

実験結果

リサーチクエスチョン

  • RQ1ネットワーク出力と真のラベルの間の相互情報量が、深層学習における動的学習率調整の信頼できるシグナルとして機能するか。
  • RQ2MIの変化とその相対的値の両方を追跡することで、静的または勾配ベースの学習率ポリシーと比較して、訓練の効率性とモデル性能が向上するか。
  • RQ3MIに基づく学習率スケジューリングは、手動での再調整なしに、バッチサイズの変更に対しても効果的に応答できるか。
  • RQ4層別MIに基づく学習率適応は、深層ネットワークの訓練ダイナミクスの改善に実現可能かつ有益か。
  • RQ5MIに基づく動的学習率は、標準的な固定学習率スケジュールと比較して、正確性と訓練時間の両面で優れているか。

主な発見

  • MIに基づく動的学習率ポリシーは、MNISTおよびCIFAR-10の両データセットで、固定学習率スケジュールと同等またはそれ以上のテスト精度を達成した。
  • 動的学習率ポリシーを用いた訓練は、同等または優れた性能に到達するまでの時間が短く、訓練の効率性が向上したことを示した。
  • 本手法は、訓練中にバッチサイズが増加しても正常に適応し、手動での介入なしに性能を維持するための学習率の自動調整が可能であった。
  • 基準値(IXY)の使用により、ネットワークが情報容量に対して性能を発揮していない状況を検出し、補正的な学習率調整が可能になった。
  • 層別MIに基づく学習率スケジューリングは、競争的な時間内に競争的な結果を達成し、MIを用いた各層の最適化の実現可能性を示した。
  • KSG推定法は1000のサンプルサイズで安定したMI推定を提供し、大規模な訓練においても各エポックごとのMI計算が実用可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。