[论文解读] Time-Sensitive Bandit Learning and Satisficing Thompson Sampling
本文提出满足性汤普森采样(STS),一种面向时间敏感的多臂赌博机算法,其优化目标为折现遗憾而非累积遗憾,从而在最优动作难以识别时能更快收敛至近似最优动作。该文基于信息论提出一种新颖的遗憾边界,结合率失真理论,表明 STS 在有限时域和高性能次优动作并存的场景下,显著优于标准汤普森采样和 UCB 算法。
The literature on bandit learning and regret analysis has focused on contexts where the goal is to converge on an optimal action in a manner that limits exploration costs. One shortcoming imposed by this orientation is that it does not treat time preference in a coherent manner. Time preference plays an important role when the optimal action is costly to learn relative to near-optimal actions. This limitation has not only restricted the relevance of theoretical results but has also influenced the design of algorithms. Indeed, popular approaches such as Thompson sampling and UCB can fare poorly in such situations. In this paper, we consider discounted rather than cumulative regret, where a discount factor encodes time preference. We propose satisficing Thompson sampling -- a variation of Thompson sampling -- and establish a strong discounted regret bound for this new algorithm.
研究动机与目标
- 解决标准多臂赌博机算法在短时域、高不确定性场景下对时间偏好和早期性能关注不足的问题。
- 克服当识别最优动作成本过高时,汤普森采样和 UCB 算法效率低下的问题。
- 构建一个考虑时间偏好和部分信息的折现遗憾分析理论框架。
- 提出一种改进的汤普森采样算法,聚焦于识别近似最优而非仅最优的动作,以提升早期性能。
- 基于率失真理论建立遗憾边界,量化满足性而非最优性所带来信息价值。
提出的方法
- 提出满足性汤普森采样(STS),一种基于动作与 ε-最优阈值接近程度而非严格最优性的汤普森采样变体。
- 使用折扣因子 α ∈ (0,1) 建模时间偏好,将问题表述为最小化期望折现遗憾。
- 应用率失真理论以边界信息比率,将信息价值与识别足够优动作的能力联系起来。
- 定义基准动作 Â 为首次采样到的 ε-最优动作,并利用其熵 H(Â|ξ) 量化不确定性与信息增益。
- 通过信息比率 Γ(Â, {At}) 推导一般遗憾边界,该比率衡量信息增益与遗憾之间的权衡。
- 在两种无限臂赌博机变体上实例化该一般边界:一种为确定性奖励,另一种为噪声观测,从而得出明确的遗憾表达式。
实验结果
研究问题
- RQ1如何重新设计多臂赌博机算法,使其优先考虑早期性能与时间偏好,而非渐近最优性?
- RQ2当最优动作难以或成本过高时,汤普森采样的理论性能如何?
- RQ3率失真理论能否用于建立反映识别近似最优动作信息价值的遗憾边界?
- RQ4在有限时域条件下,满足性汤普森采样与标准汤普森采样及 UCB 在折现遗憾方面表现如何比较?
- RQ5先验知识与观测噪声对追求满足性而非最优性能的算法的遗憾有何影响?
主要发现
- 在确定性无限臂赌博机中,当 ε = √((1−α)/2) 时,STS 达到折现遗憾边界 √(2/(1−α)),表现出在时间折现下的优异性能。
- 在具有 δ 概率的先验知识(即动作为 ε-最优)的噪声无限臂赌博机中,STS 实现遗憾边界 Õ(ε/(1−α) + √(1/(δ(1−α²)))),表明其在先验知识支持下具备可扩展性。
- 遗憾边界与首个被识别的 ε-最优动作的熵 H(Â|ξ) 成比例,该熵捕捉了学习满足性动作过程中的不确定性。
- 当最优动作学习成本较高时,STS 在模拟实验中显著优于标准汤普森采样和 UCB,尤其在早期时间步表现突出。
- 基于率失真理论的信息论框架为时间敏感决策与有损数据压缩之间提供了严谨的联系,从而实现更紧致的遗憾边界。
- 一般遗憾边界在确定性与噪声观测模型下均成立,且每种情形均推导出明确的表达式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。