Skip to main content
QUICK REVIEW

[論文レビュー] A sequential Monte Carlo approach to Thompson sampling for Bayesian optimization

Hildo Bijl, Thomas B. Schön|arXiv (Cornell University)|Apr 1, 2016
Advanced Bandit Algorithms Research参考文献 28被引用数 13
ひとこと要約

本稿では、連続入力空間におけるベイズ最適化のためのトフサムサンプリングを可能にする、逐次モンテカルロに基づくアルゴリズムを提案する。非線形の獲得関数最適化を必要とせず、ガウス過程の最大値の分布を近似可能である。本手法は、累積リグレット性能において競争力があり、風力タービン制御機のオンラインでデータ駆動型のチューニングに有効であることを示している。

ABSTRACT

Bayesian optimization through Gaussian process regression is an effective method of optimizing an unknown function for which every measurement is expensive. It approximates the objective function and then recommends a new measurement point to try out. This recommendation is usually selected by optimizing a given acquisition function. After a sufficient number of measurements, a recommendation about the maximum is made. However, a key realization is that the maximum of a Gaussian process is not a deterministic point, but a random variable with a distribution of its own. This distribution cannot be calculated analytically. Our main contribution is an algorithm, inspired by sequential Monte Carlo samplers, that approximates this maximum distribution. Subsequently, by taking samples from this distribution, we enable Thompson sampling to be applied to (armed-bandit) optimization problems with a continuous input space. All this is done without requiring the optimization of a nonlinear acquisition function. Experiments have shown that the resulting optimization method has a competitive performance at keeping the cumulative regret limited.

研究の動機と目的

  • 従来の獲得関数最適化が計算的に高コストである連続入力空間におけるベイズ最適化の課題に対処すること。
  • 解析的に扱えないガウス過程の最大値の分布を近似する手法を開発すること。
  • 最大値の分布からのサンプリングによって、連続腕バンディット問題におけるトフサムサンプリングを可能にすること。
  • 高価でノイズの多い関数を対象とした、実世界の応用(例:制御機器のチューニング)に適したリグレット最小化の最適化フレームワークを提供すること。
  • 累積リグレットという観点で、既存のベイズ最適化手法と比較して競争力のある性能を示すこと。

提案手法

  • 本手法は、入力空間におけるガウス過程の最大値の分布を近似するために逐次モンテカルロ(SMC)サンプリングを用いる。
  • 観測されたノイズ付き関数評価に基づき、繰り返しにわたって粒子を伝搬・再サンプリングし、関数最大値の事後分布を表現する。
  • 得られた粒子近似により、次回の評価点選択のためのトフサムサンプリングが可能になる。これは、推定された最大値分布からのランダムサンプリングを可能にする。
  • 期待改善や改善確率といった非線形獲得関数の最適化を直接回避するため、最大値分布からの直接サンプリングによって実現する。
  • 各新しい観測値がガウス過程の事後分布とSMC近似を更新するベイズ最適化ループに本手法を統合する。
  • 性能は風力タービン制御機のチューニング問題を用いて評価され、複数回の最適化実行における累積リグレットで測定される。

実験結果

リサーチクエスチョン

  • RQ1連続入力空間において、解析的に扱えないガウス過程の最大値の分布を、逐次モンテカルロアプローチで効果的に近似できるか?
  • RQ2本手法による粒子ベースの最大値分布近似を用いて、連続腕バンディット問題に効果的にトフサムサンプリングを適用できるか?
  • RQ3提案手法は、既存のベイズ最適化手法と比較して、累積リグレット性能で競争力を持つか?
  • RQ4非線形獲得関数の最適化に伴う計算負荷を回避しつつ、高い最適化性能を維持できるか?
  • RQ5風力タービン制御機のチューニングのような、実世界の高コスト最適化シナリオにおいて、本手法はどのように性能を発揮するか?

主な発見

  • 提案されたモンテカルロ最大値分布(MCMD)アルゴリズムは、逐次モンテカルロサンプリングを用いて、ガウス過程の最大値の分布を効果的に近似した。
  • 非線形獲得関数の最適化を必要とせず、連続入力空間におけるトフサムサンプリングを可能にした。これにより、次回の評価点選択が簡素化された。
  • 風力タービン制御機のチューニング実験では、最先端のベイズ最適化アルゴリズムと同等の水準の累積リグレットを達成した。
  • 50回の独立実行において、アルゴリズムは一貫したリグレット最小化を示し、高いロバストネスを示した。
  • 高次元でノイズが多く、高価な関数評価を伴う最適化問題においても、最大値分布の粒子ベース近似が有効であることが示された。
  • 結果から、MCMDを用いたトフサムサンプリングは、不確実性が高く評価コストの高いシステムにおけるオンラインでデータ駆動型の最適化の実用的で効率的な代替手段であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。