[论文解读] Censored Semi-Bandits: A Framework for Resource Allocation with Censored Feedback
本文提出了右删失半-bandit(Censored Semi-Bandits, CSB)框架,这是一种新型的序列资源分配方法,其反馈基于隐藏阈值被删失:仅当资源分配低于该阈值时,损失才会被观测到。作者建立了该框架与多play多臂bandit(MP-MAB)及组合半-bandit的等价性,通过适配现有算法实现了最优遗憾保证,并通过实证验证表明遗憾呈次线性增长。
In this paper, we study censored Semi-Bandits, a novel variant of the semi-bandits problem. The learner is assumed to have a fixed amount of resources, which it allocates to the arms at each time step. The loss observed from an arm is random and depends on the amount of resources allocated to it. More specifically, the loss equals zero if the allocation for the arm exceeds a constant (but unknown)threshold that can be dependent on the arm. Our goal is to learn a feasible allocation that minimizes the expected loss. The problem is challenging because the loss distribution and threshold value of each arm are unknown. We study this novel setting by establishing its `equivalence' to Multiple-Play Multi-Armed Bandits(MP-MAB) and Combinatorial Semi-Bandits. Exploiting these equivalences, we derive optimal algorithms for our setting using existing algorithms for MP-MABand Combinatorial Semi-Bandits. Experiments on synthetically generated data validate performance guarantees of the proposed algorithms.
研究动机与目标
- 建模现实世界中反馈基于隐藏阈值被删失的序列资源分配问题,例如警察巡逻或偷猎控制。
- 形式化一种基于阈值的行为模型,其中仅当资源分配低于特定臂的隐藏阈值时,损失才会被观测到。
- 开发在未知阈值和平均损失下最小化期望损失的算法,并提供可证明的遗憾保证。
- 通过引入一个可处理的、非对抗性的学习框架,弥合静态历史数据方法与博弈论模型之间的差距。
- 通过在不同资源和阈值条件下进行的合成实验,验证所提出算法的性能。
提出的方法
- 将右删失半-bandit(CSB)问题形式化为一个具有K个臂、Q个可分割资源、每条臂损失服从伯努利分布的序列学习任务。
- 引入基于阈值的反馈机制:仅当分配给臂i的资源低于隐藏阈值θ_i时,损失才会被观测到。
- 建立CSB问题在相同阈值条件下的等价性与多play多臂bandit(MP-MAB)的关系,从而可使用MP-MAB算法。
- 建立CSB问题在臂相关阈值条件下的等价性与组合半-bandit的关系,从而可适配组合bandit算法。
- 将阈值估计与平均损失估计解耦,以实现高效学习,对两种变体分别采用UCB和Thompson Sampling算法。
- 推导理论遗憾界:E[R_T] ≤ O(K log T / ∇_min),其中∇_min为最优与次优分配之间的最小差距。
实验结果
研究问题
- RQ1如何建模反馈基于隐藏阈值被删失的资源分配问题,以反映现实世界中的行为响应?
- RQ2右删失半-bandit框架能否在形式上简化为已知的bandit设置,如MP-MAB和组合半-bandit?
- RQ3在未知阈值和平均损失下,右删失半-bandit框架中的学习最优遗憾保证是什么?
- RQ4资源数量和阈值大小如何影响反馈可用性及CSB中的学习性能?
- RQ5在CSB设置中,基于Thompson Sampling的算法是否在经验遗憾方面优于基于UCB的算法?
主要发现
- 在相同阈值条件下,CSB框架在形式上等价于多play多臂bandit(MP-MAB),从而可直接使用现有MP-MAB算法并获得最优遗憾保证。
- 在臂相关阈值条件下,CSB框架等价于组合半-bandit,允许适配组合bandit算法以实现最优性能。
- CSB-DT算法的期望遗憾被限制为E[R_T] ≤ O(K log T / ∇_min),表明其随时间跨度T呈次线性增长。
- 实证结果表明,随着资源分配增加,遗憾随之上升,这是由于反馈减少(从半-bandit退化为bandit模式),与理论预期一致。
- 在合成实验中,基于Thompson Sampling的CSB-DT优于其基于UCB的对应算法(CSB-DT-UCB),证实了其更优的经验性能。
- 该框架成功实现了阈值与平均损失估计的解耦,支持高效学习,并为未来联合估计提供了基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。