[论文解读] Thompson Sampling in Non-Episodic Restless Bandits
该论文提出了一种用于非周期性非平稳多臂赌博机的动态周期汤普森采样变体(TSDE),其中臂的奖励分布随时间演变。通过使用策略映射将TSDE适配到非平稳赌博机框架,作者建立了$\mathcal{O}(\sqrt{T}\log T)$的贝叶斯遗憾界,解决了无限时域设定下子线性遗憾的开放问题。
Restless bandit problems assume time-varying reward distributions of the arms, which adds flexibility to the model but makes the analysis more challenging. We study learning algorithms over the unknown reward distributions and prove a sub-linear, $O(\sqrt{T}\log T)$, regret bound for a variant of Thompson sampling. Our analysis applies in the infinite time horizon setting, resolving the open question raised by Jung and Tewari (2019) whose analysis is limited to the episodic case. We adopt their policy mapping framework, which allows our algorithm to be efficient and simultaneously keeps the regret meaningful. Our algorithm adapts the TSDE algorithm of Ouyang et al. (2017) in a non-trivial manner to account for the special structure of restless bandits. We test our algorithm on a simulated dynamic channel access problem with several policy mappings, and the empirical regrets agree with the theoretical bound regardless of the choice of the policy mapping.
研究动机与目标
- 解决非周期性非平稳赌博机中实现子线性遗憾的开放问题,其中系统不会周期性重置。
- 开发一种高效的学习算法,通过确定性策略映射$\mu$与有意义的策略进行竞争。
- 将TSDE算法扩展以处理完全可观测马尔可夫决策过程中的时变奖励分布。
- 在MDP的贝尔曼方程和混合时间的一般条件下,确保理论遗憾界成立。
- 在不同策略映射(包括Whittle索引和短视策略)下,展示算法的实证鲁棒性。
提出的方法
- 将带动态周期的汤普森采样(TSDE)算法适配到具有时变臂奖励的非周期性非平稳赌博机设置。
- 使用策略映射$\mu$,将未知系统参数$\theta^\star$映射到确定性平稳策略$\pi^\star = \mu(\theta^\star)$,从而实现与有意义基线的比较。
- 为每个周期引入两种终止条件:一种确定性,一种随机,确保在不依赖周期性重置的情况下切换周期。
- 在每个周期开始时,从后验分布中采样系统参数$\theta$,并执行策略$\pi = \mu(\theta)$直至该周期结束。
- 借鉴Jung和Tewari(2019)的策略映射框架,在保持计算效率的同时确保有意义的遗憾比较。
- 通过将遗憾分解为策略不匹配和参数估计相关分量,结合浓度不等式与混合时间分析,建立理论遗憾界。
实验结果
研究问题
- RQ1在系统不会周期性重置的非周期性非平稳赌博机设置中,汤普森采样能否实现子线性遗憾?
- RQ2在时变环境中,TSDE算法在与策略映射$\mu(\theta^\star)$竞争时,是否能保持有意义的遗憾界?
- RQ3策略映射的选择(如Whittle索引、短视策略、固定臂)如何影响算法的实证性能?
- RQ4理论上的贝叶斯遗憾界$\mathcal{O}(\sqrt{T}\log T)$是否能在不同策略映射和系统参数下得到实证验证?
- RQ5算法是否能有效学习真实系统参数$\theta^\star$,如后验集中度所示?
主要发现
- 所提出的TSDE算法的贝叶斯遗憾被证明有界于$\mathcal{O}(\sqrt{T}\log T)$,解决了非周期性非平稳赌博机中子线性遗憾的开放问题。
- 实证结果表明,所有测试的策略映射(最佳固定臂、短视策略、Whittle索引)均表现出子线性贝叶斯遗憾,证实了理论界限。
- 遗憾与时间的双对数图显示斜率约为0.5,证实了理论预测的$\tilde{\mathcal{O}}(\sqrt{T})$缩放关系。
- 在频率学设定下,TSDE的时间平均累积奖励收敛至$J_{\pi^\star}(\theta^\star)$的基准值,表明学习效果良好。
- 所有臂的真参数后验权重单调增加至1,表明在Whittle索引策略下对$\theta^\star$的学习具有一致性。
- 无论选择何种策略映射,该算法均保持高效与鲁棒,不同竞争策略下性能无下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。