Skip to main content
QUICK REVIEW

[論文レビュー] Reinforced Few-Shot Acquisition Function Learning for Bayesian Optimization

Bing-Jing Hsieh, Ping-Chun Hsieh|arXiv (Cornell University)|Jun 8, 2021
Machine Learning and Data Classification被引用数 6
ひとこと要約

本稿では、ベイジアン深層Qネットワーク(DQN)を用いて、最小限のメタデータを用いて多様なブラックボックス関数に迅速に適応可能な、獲得関数の分布を学習する強化された少数ショット獲得関数学習(FSAF)フレームワークを提案する。Kullback-Leibler正則化、デモ誘導型事前分布、およびベイジアンモデルに依存しないメタラーニングからのメタロスを統合することで、FSAFは過学習を軽減し、合成的および実世界の最適化タスクにおいて最先端のレグレット性能を達成する。

ABSTRACT

Bayesian optimization (BO) conventionally relies on handcrafted acquisition functions (AFs) to sequentially determine the sample points. However, it has been widely observed in practice that the best-performing AF in terms of regret can vary significantly under different types of black-box functions. It has remained a challenge to design one AF that can attain the best performance over a wide variety of black-box functions. This paper aims to attack this challenge through the perspective of reinforced few-shot AF learning (FSAF). Specifically, we first connect the notion of AFs with Q-functions and view a deep Q-network (DQN) as a surrogate differentiable AF. While it serves as a natural idea to combine DQN and an existing few-shot learning method, we identify that such a direct combination does not perform well due to severe overfitting, which is particularly critical in BO due to the need of a versatile sampling policy. To address this, we present a Bayesian variant of DQN with the following three features: (i) It learns a distribution of Q-networks as AFs based on the Kullback-Leibler regularization framework. This inherently provides the uncertainty required in sampling for BO and mitigates overfitting. (ii) For the prior of the Bayesian DQN, we propose to use a demo policy induced by an off-the-shelf AF for better training stability. (iii) On the meta-level, we leverage the meta-loss of Bayesian model-agnostic meta-learning, which serves as a natural companion to the proposed FSAF. Moreover, with the proper design of the Q-networks, FSAF is general-purpose in that it is agnostic to the dimension and the cardinality of the input domain. Through extensive experiments, we demonstrate that the FSAF achieves comparable or better regrets than the state-of-the-art benchmarks on a wide variety of synthetic and real-world test functions.

研究の動機と目的

  • ベイジアン最適化における多様なブラックボックス関数に普遍的に良好に動作する1つの獲得関数を設計する課題に対処すること。
  • 大規模なメタデータセットを必要とする従来のメタラーニング手法の制限を克服し、たった1ショット程度のメタデータのみで獲得関数の迅速な適応を可能にすること。
  • 不確実性を意識したベイジアンモデリングを用いて、深層強化学習ベースの獲得関数における過学習を軽減すること。
  • 微分可能で、さまざまな最適化目的と互換性がある、汎用的かつ次元に依存しない獲得関数を開発すること。

提案手法

  • 獲得関数をQ関数として形式化し、獲得関数の微分可能かつパラメータ化されたサーヴィェイランスとして深層Qネットワーク(DQN)を用いる。
  • Kullback-Leibler正則化を用いて、Qネットワークのパラメータの分布を学習するベイジアンDQNの変種を導入し、不確実性を内蔵的にモデル化し、過学習を低減する。
  • 事前学習済みの獲得関数(例:EI)から導出されるデモポリシーを、ベイジアンDQNの事前分布として用いることで、学習の安定性を向上させる。
  • ベイジアンモデルに依存しないメタラーニング(MAML)からのメタロスを活用し、タスク間でDQNの初期化と適応を同時に最適化する。
  • 入力次元やドメインの基数に依存しないQネットワークのアーキテクチャを設計し、広範な適用可能性を実現する。
  • メタデータを用いてソースタスクの分布でFSAFモデルを訓練し、その後、新しいタスクごとにわずかなサンプルのみでファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習ベースの獲得関数は、わずかなサンプルのみで新しいブラックボックス関数に効果的に適応可能か?
  • RQ2ベイジアン最適化における少数ショット適応において、深層Qネットワークベースの獲得関数の過学習をどのように軽減できるか?
  • RQ3構造的事前分布とメタラーニング損失を備えたベイジアンDQNは、標準のDQNや手作業で設計されたAFよりも優れた一般化性能を達成できるか?
  • RQ4提案されたFSAFは、多様な合成的および実世界の最適化タスクにおいて、最先端の獲得関数をどの程度上回るか?

主な発見

  • FSAFは、広範な合成的および実世界のテスト関数において、最先端のベンチマークと同等または優れたレグレット性能を達成し、優れた一般化性能を示した。
  • KL正則化とデモベース事前分布を備えた提案されたベイジアンDQNは、標準のDQN+MAMLと比較して著しく過学習を低減したが、これは訓練性能は強くてもテスト性能に劣ることがある。
  • FSAFは滑らかさ、多次元性、ノイズレベルが異なるさまざまな種類のブラックボックス関数に対しても、頑健な性能を示した。
  • ベイジアンMAMLからのメタロスの統合により、限られたメタデータでも高速かつ安定した少数ショット適応が可能となり、性能劣化が最小限に抑えられた。
  • FSAFは汎用的かつ次元に依存せず、アーキテクチャの変更なしに低次元および高次元の入力ドメインで良好な性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。