Skip to main content
QUICK REVIEW

[論文レビュー] Transfer Learning for Bayesian Optimization on Heterogeneous Search Spaces

Fan Zhou, Xinran Han|arXiv (Cornell University)|Sep 28, 2023
Gaussian Processes and Bayesian Inference被引用数 4
ひとこと要約

本稿では、ドメイン固有の文脈を階層的ガウス過程(GP)事前分布にマップするニューラルネットワークを事前学習することで、異種の探索空間間で知識を転送できる、ベイズ最適化のための新規な転移学習手法MPHDを提案する。MPHDは、未観測の探索空間において最先端のサンプル効率を達成し、異種のドメインを含むハイパラメータチューニングベンチマークで、既存の手法を上回る性能を発揮する。

ABSTRACT

Bayesian optimization (BO) is a popular black-box function optimization method, which makes sequential decisions based on a Bayesian model, typically a Gaussian process (GP), of the function. To ensure the quality of the model, transfer learning approaches have been developed to automatically design GP priors by learning from observations on "training" functions. These training functions are typically required to have the same domain as the "test" function (black-box function to be optimized). In this paper, we introduce MPHD, a model pre-training method on heterogeneous domains, which uses a neural net mapping from domain-specific contexts to specifications of hierarchical GPs. MPHD can be seamlessly integrated with BO to transfer knowledge across heterogeneous search spaces. Our theoretical and empirical results demonstrate the validity of MPHD and its superior performance on challenging black-box function optimization tasks.

研究の動機と目的

  • 既存の転移学習手法が、トレーニング関数とテスト関数の間でドメインが一致している必要があるという制限を解消すること。
  • 多様で異種の探索空間から、新しい未観測の最適化タスクへ効果的な知識転送を可能にする手法の開発。
  • BOの軌道順序を必要とせず、順不同で分割されたデータセットから、ドメイン固有の階層的GP事前分布を学習する事前学習フレームワークの設計。
  • 手法の理論的整合性の確立と、異種ドメインを含む実世界のハイパラメータチューニングベンチマークにおける性能検証。

提案手法

  • MPHDは、ドメイン固有の文脈(例:入力次元、変数タイプなど)を、階層的GP事前分布のハイパーパラメータにマップするニューラルネットワークを事前学習する。
  • 各関数のGP事前分布を、次元ごとの長さスケールとノイズ分散の上に学習されたハイパーパラメータを持つ階層的分布としてモデル化する。
  • 異なるドメインを持つ複数の関数からなるスーパーセットデータセットを構築し、各関数のデータはそのドメイン文脈に関連付けて分割される。
  • ニューラルネットワークは、ドメイン文脈に基づいて、長さスケールの平均や分散といった事前分布パラメータを予測する。これにより、新しいドメインへの一般化が可能になる。
  • 推論段階では、事前学習済みモデルがテスト関数のドメイン文脈に基づいてカスタマイズされた階層的GP事前分布を生成し、標準的なBOと獲得関数を用いて最適化に利用する。
  • BOの軌道順序は不要で、関数ごとの分割済みデータと関連するドメインメタデータがあれば十分である。

実験結果

リサーチクエスチョン

  • RQ1ベイズ最適化における転移学習は、異なる重複のない探索空間を持つ関数間でも一般化可能か?
  • RQ2ドメインの一致を必要とせず、多様なドメインから統一されたモデルが効果的なGP事前分布を学習できるか?
  • RQ3訓練データが増加する際に、MPHDが収束性および一貫性に関してどのような理論的保証を提供するか?
  • RQ4実世界のハイパラメータチューニングタスクにおいて、異種ドメインを含む既存のBO手法と比較して、MPHDのサンプル効率はどの程度か?
  • RQ5異なるドメインを持つ関数のセットで事前学習したMPHDは、未観測の探索空間へ一般化可能か?

主な発見

  • PD1ベンチマークにおいて、テスト探索空間に事前学習されていない手法の中でMPHDが最高の性能を示し、NToT設定では、特化した均一なメタBO手法ですら上回った。
  • HPO-Bベンチマークでは、MPHDが未観測の探索空間への一般化に優れ、ベースライン手法と比較して顕著にサンプル効率が向上した。
  • 理論的整合性が確認され、訓練関数の数が増加するに従い、真の事前分布に収束した。
  • 複数のテスト関数において、標準GPおよび手動で指定された階層的GPベースラインと比較して、MPHDは正規化された単純な後悔(normalized simple regret)の観点で優れた性能を示した。
  • HPO-Bで事前学習したMPHDは、PD1データセットへも成功裏に一般化し、クロスドメインの転送能力を示した。
  • ドメイン固有の文脈の組み込みにより、入力次元や変数タイプが異なる関数間でも、効果的な事前分布の転送が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。