[论文解读] An Asymptotically Optimal Policy for Uniform Bandits of Unknown Support
本文提出了一种针对支持未知的均匀分布多臂赌博机问题的渐近最优上置信度(UCB)型策略。通过利用Kullback-Leibler散度约束对样本均值进行膨胀,该策略实现了理论上可能的最小后悔增长速率,与Burnetas和Katehakis(1996b)推导出的理论下界完全一致,并提供了有限时域的后悔界,验证了其在短期和长期时间尺度下的高效性。
Consider the problem of a controller sampling sequentially from a finite number of $N \geq 2$ populations, specified by random variables $X^i_k$, $ i = 1,\ldots , N,$ and $k = 1, 2, \ldots$; where $X^i_k$ denotes the outcome from population $i$ the $k^{th}$ time it is sampled. It is assumed that for each fixed $i$, $\{ X^i_k \}_{k \geq 1}$ is a sequence of i.i.d. uniform random variables over some interval $[a_i, b_i]$, with the support (i.e., $a_i, b_i$) unknown to the controller. The objective is to have a policy $π$ for deciding, based on available data, from which of the $N$ populations to sample from at any time $n=1,2,\ldots$ so as to maximize the expected sum of outcomes of $n$ samples or equivalently to minimize the regret due to lack on information of the parameters $\{ a_i \}$ and $\{ b_i \}$. In this paper, we present a simple inflated sample mean (ISM) type policy that is asymptotically optimal in the sense of its regret achieving the asymptotic lower bound of Burnetas and Katehakis (1996). Additionally, finite horizon regret bounds are given.
研究动机与目标
- 开发一种序列采样策略,在i.i.d.均匀赌博机的支持未知时最小化后悔。
- 通过匹配基于Kullback-Leibler散度推导出的后悔增长理论下界,实现渐近最优性。
- 提供有限时域的后悔界,以验证其在短时和长时尺度下的性能。
- 通过引入基于分布不确定性膨胀的样本均值,将UCB框架扩展至均匀赌博机。
提出的方法
- 提出一种基于膨胀样本均值的UCB型策略,其动作选择基于满足KL散度约束的分布族中期望值的上确界。
- 使用索引 $ u^i(n,t) = \sup_{g \in \mathcal{F}} \left\{ \mu(g) : \mathbf{I}(\hat{f}^i_t, g) < \frac{\ln n}{t} \right\} $,其中 $ \hat{f}^i_t $ 是赌博机 $ i $ 在 $ t $ 次采样后的经验分布。
- 应用Burnetas-Katehakis(BK)框架推导出后悔的理论下界:$ \mathbf{M}_{\text{BK}}(\{f_i\}) = \sum_{i:\mu_i \neq \mu^*} \frac{\Delta_i}{\inf_{g \in \mathcal{F}} \{ \mathbf{I}(f_i, g) : \mu(g) \geq \mu^* \}} $。
- 利用概率不等式和KL散度的尾部界,结合均匀分布的测度集中性,建立有限时域的后悔界。
- 通过数值模拟验证该策略的性能,将其与现有策略(如 $ \pi_{\text{KR}}, \pi_{\text{CHK}} $)在六组已知但支持未知的赌博机上进行比较。
- 使用一个新颖的不等式 $ \sum_{t=3}^n \frac{1}{t} \sum_{s=1}^\infty t^{-1/s} (1-\alpha)^s \leq 30 + \frac{6}{\alpha^3} $ 来控制后悔项的增长。
实验结果
研究问题
- RQ1能否为支持未知的均匀赌博机设计一种UCB风格的策略,使其在后悔方面实现渐近最优?
- RQ2此类策略的最紧致有限时域后悔界是什么?
- RQ3在短期和长期时间尺度下,该策略与现有UCB和KL基策略相比性能如何?
- RQ4基于KL散度约束的样本均值膨胀能否被严格界定,以确保收敛至最优策略?
主要发现
- 所提出的策略 $ \pi_{\text{CK}} $ 实现了渐近最优性,满足 $ \lim_{n \to \infty} \frac{R_{\pi}(n)}{\ln n} = \mathbf{M}_{\text{BK}}(\{f_i\}) $,与Burnetas和Katehakis(1996b)的理论下界完全一致。
- 建立了有限时域的后悔界,表明该策略的后悔随 $ n $ 对数增长,证实了其在实际应用中的高效性。
- 数值模拟表明,$ \pi_{\text{CK}} $ 在短期和长期时间尺度下均显著优于 $ \pi_{\text{KR}} $ 和 $ \pi_{\text{CHK}} $,尤其在早期阶段表现更优。
- 推导并应用了不等式 $ \sum_{t=3}^n \frac{1}{t} \sum_{s=1}^\infty t^{-1/s} (1-\alpha)^s \leq 30 + \frac{6}{\alpha^3} $,以控制后悔增长,确保在不同参数配置下的一致性。
- 通过KL散度约束的均值膨胀设计策略,确保探索过程基于最坏情况的分布不确定性,从而实现稳健且高效的采样。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。