Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Sensor Placement for Continuous Spaces

James A. Grant, Alexis Boukouvalas|arXiv (Cornell University)|May 16, 2019
Advanced Bandit Algorithms Research被引用数 8
ひとこと要約

本稿では、非パラメトリックベイズヒストグラムを用いて非定常ポアソン過程の発生率を推定することで、連続区間における適応的センサ配置のためのトムプソンサンプリングに基づくアルゴリズムを提案する。$×(T^{2/3})$ のベイジアンレグレットバウンドを達成し、下位でかつより変動が小さいレグレットを示すシミュレーションにおいて、UCBおよび$¥$-greedy手法を上回る性能を発揮する。

ABSTRACT

We consider the problem of adaptively placing sensors along an interval to detect stochastically-generated events. We present a new formulation of the problem as a continuum-armed bandit problem with feedback in the form of partial observations of realisations of an inhomogeneous Poisson process. We design a solution method by combining Thompson sampling with nonparametric inference via increasingly granular Bayesian histograms and derive an $ ilde{O}(T^{2/3})$ bound on the Bayesian regret in $T$ rounds. This is coupled with the design of an efficent optimisation approach to select actions in polynomial time. In simulations we demonstrate our approach to have substantially lower and less variable regret than competitor algorithms.

研究の動機と目的

  • 連続区間における逐次的センサ配置を、ポアソン過程フィードバックを伴う連続的腕バンディット問題としてモデル化すること。
  • 重尾的で点過程フィードバックであるイベント発生率関数の連続的空間における学習の課題に対処すること。
  • 探索と活用のバランスを保ちつつ、ベイジアンレグレットを最小限に抑える効率的なアルゴリズムの設計。
  • 既知の発生率関数下でのセンサ配置のスケーラブルな最適化ルーチンの開発。
  • 事前分布の選択に依存しない理論的レグレットバウンドの提供。

提案手法

  • センサ配置を、部分観測が非定常ポアソン過程から得られる連続的腕バンディット問題として定式化する。
  • 連続的行動空間における非パラメトリック推定のため、ますます細分化されるベイズヒストグラムを用いる。
  • 各ビンの発生率の事後分布からのサンプルに基づいて、トムプソンサンプリングを用いて行動を選択する。
  • メッシュを時間とともに細かくすることで解像度を向上させるプログレッシブな離散化戦略を採用する。
  • サンプルされた発生率関数の最適なセンサ配置を計算するための効率的な最適化ルーチンを統合する。
  • ルッソ&ヴァンロイ(2014)の手法を用いて、$\tilde{O}(T^{2/3})$ のベイジアンレグレットバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1非パラメトリックベイズヒストグラムを用いたトムプソンサンプリングは、ポアソンフィードバックを伴う連続的センサ配置において、探索と活用を効果的にバランスさせることができるか?
  • RQ2このような方策の理論的レグレット性能は、$T$ の観点からどのように評価できるか?
  • RQ3再ビンニングレートの選択が、事後推定の正確性およびレグレットにどのように影響するか?
  • RQ4提案手法は、UCBおよび$\epsilon$-greedyベースラインと比較して、レグレットと分散の観点でどのように性能を発揮するか?
  • RQ5多項式時間内で計算効率を維持しながら、低レグレットを達成できるか?

主な発見

  • トムプソンサンプリングは、すべてのシミュレーション設定においてUCB、$\epsilon$-greedy、および修正版UCB方策よりも一貫して低いレグレットを達成した。
  • UCB方策は、900イテレーションを経ても、特に低活動領域において発生率を過大評価したため、高いレグレットを示した。
  • $\epsilon$-greedy法は、探索が不十分なためにレグレットの分散が高く、局所最適解からの脱出に主に確率的選択に依存していた。
  • 事後分散の分析により、トムプソンサンプリングが高発生率領域に観測を集約しながら、未探索領域では不確実性を維持していることが確認された。
  • 立方根再ビンニングレートが最も正確な事後推定と最小のレグレットを達成し、線形および平方根レートを上回った。
  • 理論的レグレットバウンド$\tilde{O}(T^{2/3})$ は、より単純なCABモデルにおける$\Omega(T^{2/3})$ の下界に近く、強力な理論的性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。