[论文解读] New Insights into Bootstrapping for Bandits
本文揭示了在老虎机问题中非参数自举法(NPB)存在根本性的理论缺陷,证明其在伯努利分布老虎机设置下可能产生近乎线性遗憾。为此,本文提出加权自举法(WB),该方法在伯努利和高斯奖励下在数学上等价于汤普森采样(TS),并实现近乎最优遗憾,同时在有界分布上实证表现优于NPB和标准TS。
We investigate the use of bootstrapping in the bandit setting. We first show that the commonly used non-parametric bootstrapping (NPB) procedure can be provably inefficient and establish a near-linear lower bound on the regret incurred by it under the bandit model with Bernoulli rewards. We show that NPB with an appropriate amount of forced exploration can result in sub-linear albeit sub-optimal regret. As an alternative to NPB, we propose a weighted bootstrapping (WB) procedure. For Bernoulli rewards, WB with multiplicative exponential weights is mathematically equivalent to Thompson sampling (TS) and results in near-optimal regret bounds. Similarly, in the bandit setting with Gaussian rewards, we show that WB with additive Gaussian weights achieves near-optimal regret. Beyond these special cases, we show that WB leads to better empirical performance than TS for several reward distributions bounded on $[0,1]$. For the contextual bandit setting, we give practical guidelines that make bootstrapping simple and efficient to implement and result in good empirical performance on real-world datasets.
研究动机与目标
- 识别非参数自举法(NPB)在多臂老虎机设置中的理论局限性。
- 提出一种加权自举法(WB),使其在常见分布下实现近乎最优遗憾,并与汤普森采样(TS)保持一致。
- 为在上下文老虎机中实现自举法提供实用且无需超参数调优的指导。
- 在各种奖励分布和真实世界数据集上,对WB与NPB和TS进行实证评估。
提出的方法
- 本文提出加权自举法(WB),其中对伯努利奖励的自举样本采用乘法指数权重进行抽取。
- 对于高斯奖励,WB使用加法高斯权重,从而实现近乎最优的遗憾边界。
- WB在伯努利和高斯奖励假设下,被证明在数学上等价于汤普森采样(TS)。
- 在上下文老虎机设置中,作者提出一种无需参数的初始化方法,利用上下文协方差矩阵的特征向量以保持特征方差。
- 该方法使用带热启动的随机梯度下降,跨轮次高效计算自举模型的最大似然估计。
- 实证评估采用逻辑回归、神经网络和线性模型结合自举采样,避免了超参数调优。
实验结果
研究问题
- RQ1在具有伯努利奖励的多臂老虎机设置中,非参数自举法(NPB)是否可被证明效率低下?
- RQ2加权自举法(WB)在具有伯努利和高斯奖励的老虎机问题中是否能实现近乎最优遗憾?
- RQ3WB在有界奖励分布上与汤普森采样(TS)和非参数自举法(NPB)相比,实证表现如何?
- RQ4能否在无需超参数调优的情况下,使自举法在上下文老虎机中变得实用且高效?
- RQ5何种初始化策略可确保在无需强制探索的情况下,自举法在上下文老虎机中表现良好?
主要发现
- 在伯努利老虎机设置中,NPB存在近乎线性遗憾的下界,证明其可被证明效率低下。
- 使用强制探索的NPB可实现次线性但次优的遗憾,表明该方法存在固有局限性。
- 采用乘法指数权重的WB在伯努利奖励下在数学上等价于汤普森采样(TS),并实现近乎最优遗憾。
- 对于高斯奖励,采用加法高斯权重的WB同样实现近乎最优的遗憾边界。
- 在真实世界数据集(CovType和MNIST)上,使用逻辑回归和神经网络的WB优于NPB,并与调优后的ε-贪婪方法相当或更优。
- 在CovType数据集上,WB使用逻辑回归的平均耗时为每轮0.16秒;在MNIST数据集上为每轮1.88秒,表明其计算效率高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。