[論文レビュー] Tasks, stability, architecture, and compute: Training more effective learned optimizers, and using them to train themselves
この論文は、大規模な計算資源を用いて数千の多様な機械学習タスクで訓練されたスケーラブルで汎用的な学習最適化手法を紹介する。階層的なニューラルアーキテクチャを採用し、検証損失やその他のタスク特徴にアクセスすることで、頑健な一般化性能と自己学習能力を実現し、安定性、適応性、分布外性能の面で先行手法を上回る。
Much as replacing hand-designed features with learned functions has revolutionized how we solve perceptual tasks, we believe learned algorithms will transform how we train models. In this work we focus on general-purpose learned optimizers capable of training a wide variety of problems with no user-specified hyperparameters. We introduce a new, neural network parameterized, hierarchical optimizer with access to additional features such as validation loss to enable automatic regularization. Most learned optimizers have been trained on only a single task, or a small number of tasks. We train our optimizers on thousands of tasks, making use of orders of magnitude more compute, resulting in optimizers that generalize better to unseen tasks. The learned optimizers not only perform well, but learn behaviors that are distinct from existing first order optimizers. For instance, they generate update steps that have implicit regularization and adapt as the problem hyperparameters (e.g. batch size) or architecture (e.g. neural network width) change. Finally, these learned optimizers show evidence of being useful for out of distribution tasks such as training themselves from scratch.
研究の動機と目的
- 数千の多様なタスクにスケーリングして訓練することで、先行する学習最適化手法の脆さと一般化性能の低さを克服すること。
- 検証損失やアーキテクチャメタデータなどの追加のタスク信号を組み込むことで、最適化手法の頑健性を向上させること。
- より優れた性能と一般化性能を実現するための強いインダクティブバイアスを持つ階層的でニューラルネットワークベースの最適化手法アーキテクチャを設計すること。
- 学習最適化手法が新しい最適化手法を完全から訓練できることを可能にし、自己コンパイル型コンパイラに類似した自己ホスティング能力を示すこと。
- 一般化性能と高精度を実現する低分散・高忠実度のスケーラブルで高計算資源を要するパイプラインを確立すること。
提案手法
- 最適化手法は二段階最適化により訓練される:外側のループで、多数の内側タスクにおける性能に基づいて最適化手法のパラメータが更新される。
- 階層的なニューラルネットワークアーキテクチャが勾配、検証損失、モデルハイパーパramータを処理し、適応的なパラメータ更新を生成する。
- 訓練データセットは、バッチサイズ、ネットワーク幅、データ分布の変化を含む1,000以上の多様な機械学習タスクを含む。
- 大規模スケールの訓練では約60,000コアのCPUを1か月間使用(約5,000CPU年)し、長時間のアンロールと安定した外側損失推定を可能にする。
- ホールドアウトタスク上で完全な訓練軌道を実行するための分散評価システム(評価指揮官とワーカー)を用いて一般化性能を測定する。
- RPCを用いた要約集約により、バッチ処理と確率的ログ記録を実施し、オーバーヘッドを最小限に抑え、事後分析を可能にする。
実験結果
リサーチクエスチョン
- RQ1学習最適化手法は、数個のタスクにとどまらず、数千の多様な機械学習タスクに効果的に一般化できるか?
- RQ2検証損失とアーキテクチャメタデータを組み込むことで、学習最適化手法の安定性と性能が向上するか?
- RQ3学習最適化手法は、新しい最適化手法を完全から訓練でき、自己ホスティング能力を示せるか?
- RQ4計算資源とタスクの多様性をスケーリングすることで、学習最適化手法の一般化性能と頑健性にどのような影響を与えるか?
- RQ5このようなシステムの訓練にかかる計算コストと環境的コストは何か?そして、より効率化できるか?
主な発見
- 1,000以上のタスクにわたる多様なタスク分布で訓練されたため、異なるバッチサイズやネットワーク幅を持つ未観測タスクに対しても、学習最適化手法は効果的に一般化する。
- 標準的な一次最適化手法とは異なり、更新ルールを通じて暗黙の正則化を学習し、ハイパーパramータやアーキテクチャの変化に動的に適応する。
- 新しい学習最適化手法を完全から訓練できることを示し、自己ホスティング能力を実証した。これは自己コンパイル型コンパイラに類似した重要なマイルストーンである。
- 分布外タスクにおける評価では優れた性能を示し、メタトレーニング分布を超えた頑健性を確認した。
- 訓練プロセスには約60,000コアのCPUを1か月間使用し、約200メガワットアワーのエネルギーを消費した。これは高い計算コストを示している。
- 高い計算コストであるが、著者らは、一度訓練された最適化手法であれば、下流の訓練におけるハイパーパramータチューニングの必要性がなくなるため、長期的なコスト削減が見込めるとしている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。