Skip to main content
QUICK REVIEW

[論文レビュー] Meta Learning Black-Box Population-Based Optimizers

Hugo Siqueira Gomes, Benjamin Léger|arXiv (Cornell University)|Mar 5, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用数 5
ひとこと要約

本論文は、特定の問題クラス向けに、自動的に集団ベースのブラックボックス最適化手法を学習するメタラーニングフレームワーク、Learning-to-Optimize POMDP (LTO-POMDP) を提案する。最適化を部分的に観測可能なマルコフ意思決定過程(POMDP)としてモデル化し、確率的アルゴリズムの性能に基づくメタロスで訓練することで、CMA-ESなどの最先端のアルゴリズムよりも高いサンプル効率とより優れた一般化性能を達成した。複数のベンチマークタスクおよびハイパーパramータチューニングのシナリオにおいて、最適化速度が最大2〜3倍向上した。

ABSTRACT

The no free lunch theorem states that no model is better suited to every problem. A question that arises from this is how to design methods that propose optimizers tailored to specific problems achieving state-of-the-art performance. This paper addresses this issue by proposing the use of meta-learning to infer population-based black-box optimizers that can automatically adapt to specific classes of problems. We suggest a general modeling of population-based algorithms that result in Learning-to-Optimize POMDP (LTO-POMDP), a meta-learning framework based on a specific partially observable Markov decision process (POMDP). From that framework's formulation, we propose to parameterize the algorithm using deep recurrent neural networks and use a meta-loss function based on stochastic algorithms' performance to train efficient data-driven optimizers over several related optimization tasks. The learned optimizers' performance based on this implementation is assessed on various black-box optimization tasks and hyperparameter tuning of machine learning models. Our results revealed that the meta-loss function encourages a learned algorithm to alter its search behavior so that it can easily fit into a new context. Thus, it allows better generalization and higher sample efficiency than state-of-the-art generic optimization algorithms, such as the Covariance matrix adaptation evolution strategy (CMA-ES).

研究の動機と目的

  • 一般的なブラックボックス最適化手法の限界、すなわち、複雑またはだましの効いた関数では高い評価回数を要し、性能が限定的であるという点を解決すること。
  • 手作業でカスタマイズされた最適化手法に高いコストと専門知識を要する問題を克服し、問題固有の探索戦略を自動的かつデータ駆動で学習可能にする。
  • 関連する最適化タスクからインダクティブバイアスを学習することで、ブラックボックス最適化における一般化性能とサンプル効率を向上させること。
  • 導出を必要とせず、解の順位付けのみに依存する集団ベースの最適化手法を設計し、関数変換に対して不変となるようにすること。
  • 多様な最適化シナリオ、例えばベンチマーク関数や機械学習モデルのハイパーパramータチューニングを含む、学習済み最適化手法の有効性を実証すること。

提案手法

  • 集団ベースの最適化を部分的に観測可能なマルコフ意思決定過程(POMDP)としてモデル化し、関連する最適化タスクの分布から探索方策のメタラーニングを可能にする。
  • 学習済み最適化手法のポリシーをパrameter化するために、深層再帰ニューラルネットワークを用い、内部状態を保持し、時間経過に伴い行動を適応的に変化させられるようにする。
  • 確率的ブラックボックスアルゴリズムの性能に基づき、新しいタスクに一般化し、サンプル効率を向上させるように促進する、新しいメタロス関数を設計する。
  • メタ最適化プロセスでは、目的関数の勾配計算を一切行わず、ポリシー・ネットワークを訓練するための遺伝的アルゴリズムを用いる。
  • フレームワークは関数変換に対して不変であり、各ステップでの解の相対順位のみに依存するため、耐障害性と一般化性能が向上する。
  • 複数のブラックボックス最適化タスク、例えば多峰性関数や機械学習モデルのハイパーパramータチューニングに対して評価を行い、新しいタスクに対してハイパーパramータチューニングを一切行わずに運用可能である。

実験結果

リサーチクエスチョン

  • RQ1メタラーニングを、関連する最適化タスク間で一般化可能な集団ベースのブラックボックス最適化手法に効果的に適用できるか?
  • RQ2POMDPに基づく定式化は、標準的なメタラーニング手法と比較して、ブラックボックス最適化における適応性と一般化性能を向上させられるか?
  • RQ3タスク固有のファインチューニングなしで、CMA-ESなどの最先端の汎用アルゴリズムを上回る高いサンプル効率と優れた性能を達成できるか?
  • RQ4多峰性関数の種類が異なる(グローバル構造の性質が異なる)関数において、学習済み最適化手法の一般化性能はどの程度高いか?
  • RQ5機械学習モデルの実世界のハイパーパラメータチューニングシナリオにおいて、学習済み最適化手法はベースラインを上回る性能を示せるか?

主な発見

  • 学習済み最適化手法(LPBO)は、Lunacek bi-Rastrigin関数で最大100%の成功確率、Schwefel関数で80%の成功確率を達成し、収束速度においてCMA-ESを上回った。
  • SVM、FC-Net、XGBoostのハイパーパラメータチューニングにおいて、LPBOはCMA-ESの約2倍の速度で最適化を達成した。特にXGBoostの8次元タスクで顕著であった。
  • 適切なグローバル構造を持つ多峰性関数において、LPBOはCMA-ESおよびランダムサーチを著しく上回った。特に次元数2、5、10で顕著であった。
  • グローバル構造が弱い関数では、次元数2においてLPBOはCMA-ESとほぼ同等の性能を示し、より簡単なターゲットでは高いサンプル効率を示した。
  • 異なる最適化タスク間でファインチューニングを一切必要とせず、新しい問題インスタンスへのゼロショット一般化性能が顕著に優れていた。
  • メタロス関数は、再起動や多様性保持機構といった外部メカニズムを用いずに、探索と活用のバランスを動的に最適化するように学習済み最適化手法の探索行動を適応的に制御できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。