Skip to main content
QUICK REVIEW

[論文レビュー] A Generalizable Approach to Learning Optimizers

Diogo Almeida, Clemens Winter|arXiv (Cornell University)|Jun 2, 2021
Advanced Neural Network Applications参考文献 53被引用数 4
ひとこと要約

この論文では、LSTMコントローラー、無次元特徴量、相対的行動、および新しい報酬関数を用いて最適化ハイパーパramータ(例:学習率)を学習的に更新する一般化可能な手法、LHOPT(Learnt Hyperparameter Optimizers)を提案する。この手法はImageNetで2倍の高速化、大規模言語モデリングで2.5倍の高速化を達成し、計算量に5次も以上の差があるタスク間で一般化可能であり、チューニング済みのAdamやベースライン最適化手法を上回る性能を発揮する。

ABSTRACT

A core issue with learning to optimize neural networks has been the lack of generalization to real world problems. To address this, we describe a system designed from a generalization-first perspective, learning to update optimizer hyperparameters instead of model parameters directly using novel features, actions, and a reward function. This system outperforms Adam at all neural network tasks including on modalities not seen during training. We achieve 2x speedups on ImageNet, and a 2.5x speedup on a language modeling task using over 5 orders of magnitude more compute than the training tasks.

研究の動機と目的

  • 既存の学習可能な最適化手法が訓練分布外の現実世界のタスクで失敗するという点を是正する。
  • モデルパラメータの更新ではなくハイパーパramータの更新を学習することで、タスク固有の性能よりも一般化を重視するフレームワークを構築する。
  • ポリシーの更新頻度を内部最適化ステップ数から分離することで、より広範な適用可能性を実現する。
  • 多様なニューラルネットワークアーキテクチャーやモダリティにわたる耐性と転送性を高めるために、特徴量、行動、報酬関数を設計する。
  • 学習可能な最適化手法が、計算量やモデルスケールに数次も以上の差がある現実世界の問題に一般化できることを示す。

提案手法

  • システムは、ユーザーが定めた頻度で最適化ハイパーパramータを更新するLSTMコントローラーを用い、内部最適化ステップとは独立して動作する。
  • 訓練統計(例:勾配ノルム、損失トレンド)から得られる無次元で正規化された特徴量を用いることで、タスク間での耐性を向上させる。
  • 行動はハイパーパramータに対する相対的変更(例:乗算スケーリング)として定義され、絶対値に依存しない不変性を確保する。
  • 最終的なモデル性能を最適化するよう設計された新しい報酬関数を採用し、中間指標ではなく最終的性能を重視することで一般化を促進する。
  • 強化学習を用いて、MNIST、CIFAR-10、および小規模言語モデリングタスクを含む多様な小規模タスク上でポリシーを学習する。
  • 小規模タスクで学習したハイパーパramータスケジュールを大規模モデルに再トレーニングなしに転送可能であり、ゼロショット一般化を実現する。

実験結果

リサーチクエスチョン

  • RQ1学習分布とは著しく異なり、かつ大規模なタスクに、学習可能な最適化手法が一般化可能か?
  • RQ2パラメータの更新ではなくハイパーパラメータの更新を学習することで、一般化性と計算効率が向上するか?
  • RQ3提案された報酬関数は、多様なニューラルネットワークアーキテクチャーやモダリティにわたる転送性をどの程度促進するか?
  • RQ4無次元特徴量と相対的行動は、分布シフトに対してどの程度耐性を高めるか?
  • RQ5小規模タスクで学習した1つのハイパーパラメータスケジュールが、大規模でチューニング済みのモデルで顕著な高速化を達成できるか?

主な発見

  • LHOPTsは、ターゲットタスクでのハイパーパラメータチューニングなしに、チューニング済みのAdamWと比較してImageNet学習で2倍の高速化を達成した。
  • 大規模言語モデリングタスクでは、平均170 GPU-secondsのタスクでの学習にのみ依存しているにもかかわらず、2.5倍の高速化を達成した。
  • 計算量に5次も以上の差があるタスク間で一般化可能であり、小規模タスクから最大300 GPU-日を要するモデルまでカバーした。
  • トレーニング中に見未曾有の音声認識およびニューラルコラボラティブフィルタリングタスクにおいても、MLPerfベースラインおよびチューニング済みAdamを上回った。
  • 計算コストの増加は最小限であり、Transformerでは20%未満、ResNetsでは2%未満に抑えられた。これは、効率的な特徴計算と固定サイズのポリシーネットワークのおかげである。
  • 28x28画像でのみ学習し、アテンション機構に触れることなく、それでも一般化が可能であることを示しており、タスクの多様性が従来の予想よりも重要ではない可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。