[論文レビュー] Thompson Sampling for Complex Bandit Problems
本稿では、基本的な腕の部分集合としての行動と非線形関数(例:部分集合上の最大報酬)としての報酬を伴う複雑なバンディット問題におけるトフリスサンプリングの一般化されたレグレットバウンドを提案する。問題を事後確率パスに基づく最適化として扱うことで、行動の結合性を反映したより良いレグレットスケーリングを達成し、とくにMAX報酬のような非線形フィードバックにおいて、独立した解析よりもタイトなバウンドをもたらす。
We consider stochastic multi-armed bandit problems with complex actions over a set of basic arms, where the decision maker plays a complex action rather than a basic arm in each round. The reward of the complex action is some function of the basic arms' rewards, and the feedback observed may not necessarily be the reward per-arm. For instance, when the complex actions are subsets of the arms, we may only observe the maximum reward over the chosen subset. Thus, feedback across complex actions may be coupled due to the nature of the reward function. We prove a frequentist regret bound for Thompson sampling in a very general setting involving parameter, action and observation spaces and a likelihood function over them. The bound holds for discretely-supported priors over the parameter space and without additional structural properties such as closed-form posteriors, conjugate prior structure or independence across arms. The regret bound scales logarithmically with time but, more importantly, with an improved constant that non-trivially captures the coupling across complex actions due to the structure of the rewards. As applications, we derive improved regret bounds for classes of complex bandit problems involving selecting subsets of arms, including the first nontrivial regret bounds for nonlinear MAX reward feedback from subsets.
研究の動機と目的
- 結合された行動と集約的フィードバックを伴う複雑なバンディット問題におけるトフリスサンプリングの一般レグレットバウンドの開発。
- 個々の腕の報酬ではなく、集約報酬(例:最大値、合計)のみが観測される状況の取り扱い。
- 共役事前分布、閉形式の事後分布、腕間の独立性といった制限的な仮定の排除。
- 報酬関数の結合性に起因する複雑な行動間の構造的依存関係を捉えた、よりタイトなレグレットバウンドの導出。
- 部分集合選択バンディット問題における非線形MAXフィードバックのための、初めての非自明なレグレットバウンドの提供。
提案手法
- パラメータ空間、行動空間、観測空間を用いて、それらの上に尤度関数を定義することで、複雑なバンディット問題を形式化する。
- 基本的腕のパラメータに対して離散的サポートを持つ架空の事前分布を用いてトフリスサンプリングを適用し、各観測後に事後分布を更新する。
- 事後分布の進化をパスに基づく最適化問題としてモデル化し、指数型KL発散度を用いてレグレットをバウンドする。
- N次元ハイパーキューブにおける鋭い組合せ的推定を用いて、MAXフィードバックケースを分析する。
- 時間に対して対数的にスケーリングするが、行動の構造的結合性のおかげで定数が改善されたレグレットバウンドを導出する。
- 複雑なモデルにおける実用的な事後分布近似のため、パarticleフィルタリングと逐次モンテカルロを活用する。
実験結果
リサーチクエスチョン
- RQ1結合的で非線形なフィードバックを伴う複雑なバンディット問題において、トフリスサンプリングは証明可能な低レグレットを達成できるか?
- RQ2複雑な行動間の構造的結合性は、トフリスサンプリングのレグレットスケーリングにどのように影響するか?
- RQ3共役でない、離散的事前分布を用いても、トフリスサンプリングは効果的に機能し、レグレット保証を失わないか?
- RQ4報酬が部分集合上の最大報酬のような非線形関数である場合、レグレットバウンドはどの程度改善されるか?
- RQ5行動空間における組合せ的構造を活用することで、レグレットバウンドをさらに改善できるか?
主な発見
- トフリスサンプリングの一般レグレットバウンドは、共役事前分布や閉形式の事後分布がなくても、O(log T)にスケーリングし、行動の結合性を反映した改善された定数を有する。
- 部分集合行動を伴うMAXフィードバックバンディットでは、ナイーブな分離バウンドに対して、(N−M)/N の要因でレグレットバウンドが低減される。
- L 個の非最適行動が最適モデルからのKL発散度によって区別可能である場合、追加で Ω(L/Δ log T) の削減が達成される。
- MAXフィードバックケースでは、レグレットは O( (N−1 choose M) log T / μ²_min ) にスケーリングされ、ナイーブな O( (N choose M) log T / μ²_min ) バウンドよりも著しく良好である。
- この改善は理論的ではなく、実験的結果から実際のレグレット低減は実用的にははるかに大きい可能性がある。
- 分析はハイパーキューブ頂点の鋭い組合せ的推定に依存し、事後分布の集中を新たにパスベースで扱うアプローチを提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。