Skip to main content
QUICK REVIEW

[論文レビュー] Asymptotic Behavior of Minimal-Exploration Allocation Policies: Almost Sure, Arbitrarily Slow Growing Regret

Wesley Cowan, Michael N. Katehakis|arXiv (Cornell University)|May 12, 2015
Advanced Bandit Algorithms Research参考文献 9被引用数 7
ひとこと要約

本稿では、任意の緩やかに増加する関数 g(n)(例えば反復対数関数)に対して、確率1で pseudo-regret の成長が O(g(n)) に抑えられる2つの新しい最小探索割り当て方針—g-Forcing および g-Inflated Sample Mean—を導入する。主な貢献は、有限の平均と分散の仮定のみで、いかなるバンドイット分布に対しても、任意に遅い、確率1で収束するレジームを保証する方針の存在を示したことにある。

ABSTRACT

The purpose of this paper is to provide further understanding into the structure of the sequential allocation ("stochastic multi-armed bandit", or MAB) problem by establishing probability one finite horizon bounds and convergence rates for the sample (or "pseudo") regret associated with two simple classes of allocation policies $π$. For any slowly increasing function $g$, subject to mild regularity constraints, we construct two policies (the $g$-Forcing, and the $g$-Inflated Sample Mean) that achieve a measure of regret of order $ O(g(n))$ almost surely as $n o \infty$, bound from above and below. Additionally, almost sure upper and lower bounds on the remainder term are established. In the constructions herein, the function $g$ effectively controls the "exploration" of the classical "exploration/exploitation" tradeoff.

研究の動機と目的

  • 確率的マルチアームバンドイット問題における逐次的割り当て方針の pseudo-regret に対して、確率1で成立する、サンプルパスワイズな上限を確立すること。
  • いかなる元のバンドイット分布に対しても、任意に遅い、確率1で成長するレジーム率を達成する方針を構築すること。
  • 探索と活用のトレードオフを、ユーザーが定義する緩やかに増加する関数 g(n) によって制御できることを示すこと。この関数がレジーム成長の速度を支配する。
  • 強い大数の法則(SLLN)と反復対数法則(LIL)を根幹とする、最小限の分布的仮定(有限の平均と分散のみ)で結果が成り立つことを示すこと。
  • バンドイット報酬の i.i.d. 仮定を緩和し、SLLN と LIL が各アームの報酬に対して成り立つより一般的な確率過程へ拡張可能であることを示すこと。

提案手法

  • g-Forcing および g-Inflated Sample Mean (g-ISM) の2つの方針クラスを提案。関数 g(n) が、非最適アームの標本回数の目標値を設定することで、探索を制御する。
  • 強大数の法則(SLLN)を用いて、標本平均が真の平均に確率1で収束することを保証し、反復対数法則(LIL)を用いて、変動項の上限を定める。
  • pseudo-regret を R̃π(n) = ∑ΔiTπi(n) と定義し、両方の方針が R̃π(n) = Cπg(n) + o(g(n)) という形で確率1で成立することを証明する。
  • 剰余項の確率1での上界および下界を確立し、g-Forcing は有界な変動(定数の範囲内)を示すが、g-ISM は O(√(g(n)lnln g(n))) の変動を示すことを示す。
  • g-Forcing はすべての非最適アームを概ね g(n) 回サンプリングするが、g-ISM は 1/Δi に比例してサンプリングするため、よりメリットに基づいた配分となる。
  • 各アームの報酬に対して SLLN と LIL が成り立つ限り、i.i.d. 仮定を緩和しても結果が成立することを証明する。

実験結果

リサーチクエスチョン

  • RQ1任意に緩やかに増加する関数 g(n) よりも遅い、確率1で成長するレジームを達成する割り当て方針を構築可能か?
  • RQ2探索と活用のバランスを最適化する方法は何か? これにより、任意に遅い、確率1で成長するレジーム成長を保証できるか?
  • RQ3g-Forcing と g-ISM 方針の構造的差異が、レジーム行動およびサンプリング分布に与える影響は何か?
  • RQ4バンドイット報酬の i.i.d. 仮定をどの程度緩和しても、レジームの上限が成立するか?
  • RQ5レジーム分解における剰余項の確率1での上限は何か? そして、2つの方針クラス間でその差異は何か?

主な発見

  • 緩やかに増加する関数 g(n) が弱い正則性条件を満たす限り、pseudo-regret R̃π(n) が確率1で O(g(n)) に成長する「g-良い」方針が存在する。
  • g-Forcing 方針は、pseudo-regret が SΔg(n) の周囲で定数の範囲内に変動することを保証し、剰余項は SΔ というバンドイットのギャップに依存する定数で有界である。
  • g-ISM 方針は O(√(g(n)lnln g(n))) の変動上限を示すが、そのサンプリング戦略はよりメリットに基づいており、ギャップが大きいアームにはより少ないサンプルが割り当てられる。
  • g-Forcing 方針は、アームの質にかかわらず、すべての非最適アームを概ね g(n) 回サンプリングするため、探索においてより民主的である。
  • g-ISM 方針は、非最適アームを概ね g(n)/Δi 回サンプリングする。これは、アームの期待されるレジーム寄与度を反映しており、最適に近いアームに有利に働く。
  • 有限の平均と分散のみを仮定すれば十分であり、報酬の i.i.d. 構造を緩和しても結果は成立する。SLLN と LIL が各アームに対して成り立てばよい。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。