Skip to main content
QUICK REVIEW

[论文解读] POND: Pessimistic-Optimistic oNline Dispatching

Xin Liu, Bin Li|arXiv (Cornell University)|Oct 20, 2020
Advanced Bandit Algorithms Research被引用 5
一句话总结

POND 是一种新颖的在线调度算法,结合了上置信界(UCB)用于奖励估计,以及 MaxWeight 与悲观虚拟队列,以在奖励最大化和约束满足之间取得平衡。在未知到达率、奖励和约束分布的情况下,该算法实现了 $O(\sqrt{T})$ 的遗憾和 $O(1)$ 的约束违规,这些是紧致边界,已在合成数据集和真实世界数据集(包括在线辅导数据)上得到验证。

ABSTRACT

This paper considers constrained online dispatching with unknown arrival, reward and constraint distributions. We propose a novel online dispatching algorithm, named POND, standing for Pessimistic-Optimistic oNline Dispatching, which achieves $O(\sqrt{T})$ regret and $O(1)$ constraint violation. Both bounds are sharp. Our experiments on synthetic and real datasets show that POND achieves low regret with minimal constraint violations.

研究动机与目标

  • 设计一种在线调度算法,在到达率、奖励和约束分布未知的情况下,最大化累积奖励并满足一般线性约束。
  • 实现紧致的理论边界:$O(\sqrt{T})$ 遗憾和 $O(1)$ 约束违规,这在分布无关设定下是最优的。
  • 在不确定性下的实时调度中,平衡探索(奖励学习)与利用(约束遵守)。
  • 通过在合成数据集和真实数据集(包括来自 Amazon Mechanical Turk 的在线辅导数据)上的实验,验证所提算法的有效性。

提出的方法

  • POND 使用 UCB 或 UCB 类算法(例如 MOSS)来估计未知的平均奖励 $r_{ij}$,即为类型 $i$ 的任务分配给服务器 $j$ 时的奖励。
  • 它维护虚拟队列以跟踪累积的约束违规情况,通过降低服务速率来悲观地高估违规。
  • 在虚拟队列更新中引入一个“紧密度”常数,以确保虚拟队列高估实际违规,从而实现 $O(1)$ 的约束违规边界。
  • 在每个时间槽,MaxWeight 策略通过最大化估计奖励 $\hat{r}_{ij}$ 和虚拟队列值的加权和来选择调度决策,以平衡奖励与约束合规性。
  • 该算法将李雅普诺夫漂移分析与多臂赌博机遗憾分析相结合,利用紧密度参数连接两种理论框架。
  • 虚拟队列更新规则中引入了 $O(1/\sqrt{T})$ 缩放的紧密度项,以确保虚拟队列的增长速度慢于实际违规,从而实现恒定的违规边界。

实验结果

研究问题

  • RQ1在未知到达率、奖励和约束分布的情况下,是否能设计出一种在线调度算法,实现 $O(\sqrt{T})$ 遗憾和 $O(1)$ 约束违规?
  • RQ2如何通过虚拟队列更新中的悲观性来改善约束违规控制,同时保持低遗憾?
  • RQ3‘紧密度’常数在实现 $O(1)$ 约束违规以及平衡遗憾与约束违规方面起到什么作用?
  • RQ4与基线方法(如 Explore-Then-Commit)相比,POND 在真实和合成数据上的遗憾与约束违规表现如何?

主要发现

  • POND 实现了 $O(\sqrt{T})$ 遗憾和 $O(1)$ 约束违规,这些是紧致边界,与无约束多臂赌博机在分布无关设定下的下界一致。
  • 在虚拟队列更新中引入 $O(1/\sqrt{T})$ 的紧密度项,对实现 $O(1)$ 约束违规至关重要,这一结论通过消融实验得到验证。
  • 在合成数据上,POND 的遗憾更低,且约束违规显著低于 Explore-Then-Commit,容量和公平性违规始终保持有界。
  • 在使用 Amazon Mechanical Turk 数据的在线辅导实验中,POND 在 $T=10,000$ 个时间槽内的平均奖励达到 0.366,优于 Explore-Then-Commit 的 0.355。
  • POND 的约束违规始终保持有界且不随 $T$ 增长;而若无紧密度参数,容量违规会以 $O(\sqrt{T})$ 的速度增长,证实了紧密度参数的必要性。
  • 实验轨迹显示,POND 的约束违规随时间趋于稳定,而基线方法的违规先增加后减少,表明其存在不稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。