QUICK REVIEW
[論文レビュー] Gradient Ascent for Active Exploration in Bandit Problems
Pierre Ménard|arXiv (Cornell University)|May 20, 2019
Advanced Bandit Algorithms Research参考文献 24被引用数 10
ひとこと要約
本稿では、固定信頼度設定下でのバンディット問題におけるアクティブエクスプロレーションのための計算的に効率的な勾配上昇アルゴリズムを提案する。オンラインのラージドミラー上昇を用いて最適なサンプリング割合を近似することで、各ステップで凸最適化問題を解く必要がなくなるため、計算コストを著しく削減しつつ、漸近的最適性を達成する。
ABSTRACT
We present a new algorithm based on an gradient ascent for a general Active Exploration bandit problem in the fixed confidence setting. This problem encompasses several well studied problems such that the Best Arm Identification or Thresholding Bandits. It consists of a new sampling rule based on an online lazy mirror ascent. We prove that this algorithm is asymptotically optimal and, most importantly, computationally efficient.
研究の動機と目的
- 各ステップで複雑な凸最適化問題を解く必要がある従来のアクティブエクスプロレーションアルゴリズムの計算非効率性を解消すること。
- 正確な最適化問題の解を各反復で得ることなく、サンプリングルールが漸近的に最適なドロー割合と一致することを達成すること。
- 勾配上昇を用いてアクティブエクスプロレーション問題とオンライン凸最適化を統合し、計算効率を向上させること。
- 固定信頼度設定下での提案アルゴリズムの漸近的最適性を証明すること。
- ベストアーム同定やスレッショルドバンディットを含む、さまざまなアクティブエクスプロレーションバンディット問題への広範な適用可能性を示すこと。
提案手法
- アルゴリズムは、アーム上のサンプリング分布を反復的に更新するためにオンラインのラージドミラー上昇を用いる。
- 各ステップで、目的関数の部分勾配のみを計算し、凸最適化問題の完全な解を避ける。
- 真のパラメータの推定値を維持し、それを用いて双対目的関数における勾配上昇によってサンプリングを誘導する。
- サンプリングルールは双対最適化問題の解から導出され、勾配ステップを用いてリアルタイムに近似される。
- このアプローチは汎用的であり、互いに素で、開いており、凸な集合を対象とする任意のアクティブエクスプロレーションバンディット問題に適用可能である。
- アルゴリズムは、確率が $1 - \delta$ 以上で、停止ルールが固定信頼度制約を満たすことを保証する。
実験結果
リサーチクエスチョン
- RQ1計算的に効率的なアルゴリズムは、固定信頼度設定下のアクティブエクスプロレーションバンディット問題で漸近的最適性を達成できるか?
- RQ2各ステップで凸最適化問題を解かずに、勾配上昇を用いて最適なサンプリング割合を近似する方法は何か?
- RQ3各ステップで正確な解の代わりに部分勾配を使用した場合、アクティブエクスプロレーションアルゴリズムの漸近的性能にどのような影響があるか?
- RQ4どのようなバンディット問題のクラスにおいて、提案手法は証明可能に最適かつ効率的か?
- RQ5サンプル複雑度と計算コストの観点から、従来の手法と比較してアルゴリズムの性能はどの程度か?
主な発見
- 提案されたアルゴリズムは漸近的に最適であり、サンプル複雑度のインスタンス依存下界と一致する。
- 各ステップで正確な最適化を部分勾配の計算に置き換えることで、計算コストが著しく削減される。
- 期待されるサンプルサイズが情報理論的下界に近づく中で、$\mathbb{P}_{\mu}(\widehat{i} \neq i(\mu)) \leq \delta$ を達成する。
- 数値実験により、サンプル効率と実行時間の両面で、競合手法を上回ることが示された。
- 付録に示された反例により、特定の問題例では有界でない部分勾配に対しても、アルゴリズムがロバストであることが確認された。
- ややいなごろの正則性条件の下で、経験的サンプリング割合が最適なものに収束することが確立された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。