Skip to main content
QUICK REVIEW

[論文レビュー] Training Stronger Baselines for Learning to Optimize

Tianlong Chen, Weiyi Zhang|arXiv (Cornell University)|Oct 18, 2020
Machine Learning and Data Classification参考文献 40被引用数 6
ひとこと要約

本稿では、アーキテクチャを変更せずに既存の最適化学習(L2O)モデルの性能を著しく向上させるための改善されたトレーニング手法——段階的カリキュラム学習とオフポリシーの模倣学習——を提案する。勾まり誤差と勾配爆発の問題を軽減することで、最も単純なL2Oベースラインですら、複数のタスクでより複雑な最先端モデルを上回る性能を発揮する。これは、より良いトレーニングが、単なるアーキテクチャの革新よりも、L2Oにおける潜在能力をより効果的に引き出す鍵であることを示している。

ABSTRACT

Learning to optimize (L2O) has gained increasing attention since classical optimizers require laborious problem-specific design and hyperparameter tuning. However, there is a gap between the practical demand and the achievable performance of existing L2O models. Specifically, those learned optimizers are applicable to only a limited class of problems, and often exhibit instability. With many efforts devoted to designing more sophisticated L2O models, we argue for another orthogonal, under-explored theme: the training techniques for those L2O models. We show that even the simplest L2O model could have been trained much better. We first present a progressive training scheme to gradually increase the optimizer unroll length, to mitigate a well-known L2O dilemma of truncation bias (shorter unrolling) versus gradient explosion (longer unrolling). We further leverage off-policy imitation learning to guide the L2O learning, by taking reference to the behavior of analytical optimizers. Our improved training techniques are plugged into a variety of state-of-the-art L2O models, and immediately boost their performance, without making any change to their model structures. Especially, by our proposed techniques, an earliest and simplest L2O model can be trained to outperform the latest complicated L2O models on a number of tasks. Our results demonstrate a greater potential of L2O yet to be unleashed, and urge to rethink the recent progress. Our codes are publicly available at: https://github.com/VITA-Group/L2O-Training-Techniques.

研究の動機と目的

  • L2Oにおける学習された最適化手法の不安定さと一般化性能の低さを是正すること。これは、勾まり誤差と勾配爆発のトレードオフに起因する。
  • アーキテクチャをより複雑に設計するのではなく、トレーニング手法を改善することで、性能向上がどの程度達成可能かを調査すること。
  • 既存のSOTA L2Oモデルの性能を向上させる実用的で即座に適用可能なトレーニング強化手法を提供すること。アーキテクチャの変更なしに。
  • 将来のL2O分野の進展を公正に評価できる、より強固で信頼性の高いベースラインを確立すること。

提案手法

  • トレーニング中に段階的にL2Oモデルのアンロール長を増やす段階的カリキュラム学習スキームを導入。短期的な安定性と長期的な最適化品質の両立を図る。
  • 手作業で作成された最適化手法(例:Adam、SGD)をエキスパートのデモンストレーションとして用い、オフポリシーの模倣学習を適用。これにより、多様な最適化対象(optimizees)にわたる一般化性能が向上する。
  • 行動クラーニングの目的関数を用いて、L2Oポリシーを解析的最適化手法の最適化軌道と一致させる。トレーニングプロセスにドメイン知識を統合する。
  • カリキュラム学習と模倣学習を組み合わせ、トレーニングの安定化と一般化性能の向上を同時に達成。L2Oモデルのアーキテクチャに変更を加えない。
  • メタラーニングの観点からL2Oモデルを訓練。最適化対象の分布全体の損失を最小化する一方で、提案手法を適用して収束性とロバスト性を向上させる。
  • L2Oモデルのアーキテクチャとして標準的なLSTMを採用。モデル構造ではなくトレーニングダイナミクスに焦点を当て、トレーニングの質がアーキテクチャの複雑さを上回ることを示す。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャの変更なしに、トレーニング手法そのもので既存のL2Oモデルの性能を著しく向上させられるか?
  • RQ2段階的アンロールは、L2Oトレーニングにおける勾まり誤差と勾配爆発のトレードオフをどのように緩和するか?
  • RQ3解析的最適化手法からのオフポリシーの模倣学習は、多様な問題例にわたる学習された最適化手法の一般化性能をどの程度向上させるか?
  • RQ4改善された手法でトレーニングされた単純な初期L2Oモデルが、より複雑な最近のSOTAモデルを上回る性能を発揮できるか?
  • RQ5カリキュラム学習と模倣学習を組み合わせることで、L2Oトレーニングにおいて相乗効果が得られるか?

主な発見

  • 提案手法は、アーキテクチャを変更せずに、評価されたすべてのSOTA L2Oモデルの性能を一貫して向上させた。
  • 元々最も単純なL2Oモデル(L2O-DM [1])が、提案手法でトレーニングされた場合、より複雑な最近のモデルを上回る性能を示した。
  • 段階的カリキュラム学習は、勾まり誤差を効果的に低減し、特に長い最適化軌道においてトレーニングの安定性を高めた。
  • オフポリシーの模倣学習は一般化性能を著しく向上させ、L2OがNAS-CIFAR や LeNet といった複雑で未確認の最適化対象にも成功裏に転移できるようにした。
  • カリキュラム学習と模倣学習を組み合わせることで、両手法単体よりも顕著な性能向上が得られ、最も優れた結果をもたらした。
  • 強化されたL2Oモデルは、MLP-orig や Conv-MNIST といった複数のタスクで、最適なハイパーパrameterを調整した手作業最適化手法(例:Adam、RMSProp、SGD)を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。