[论文解读] Copeland Dueling Bandits
本文提出了两种新颖的对弈老虎机算法——柯珀兰置信上界(CCB)与可扩展柯珀兰老虎机(SCB)——适用于不存在Condorcet胜者的情境。通过针对始终存在的柯珀兰胜者,这些算法在无需严格假设的前提下实现了$Ó(K\log T)$的遗憾界,显著优于以往工作,后者或需依赖Condorcet假设,或导致$\mathcal{O}(K^2\log T)$的遗憾。
A version of the dueling bandit problem is addressed in which a Condorcet winner may not exist. Two algorithms are proposed that instead seek to minimize regret with respect to the Copeland winner, which, unlike the Condorcet winner, is guaranteed to exist. The first, Copeland Confidence Bound (CCB), is designed for small numbers of arms, while the second, Scalable Copeland Bandits (SCB), works better for large-scale problems. We provide theoretical results bounding the regret accumulated by CCB and SCB, both substantially improving existing results. Such existing results either offer bounds of the form $O(K \log T)$ but require restrictive assumptions, or offer bounds of the form $O(K^2 \log T)$ without requiring such assumptions. Our results offer the best of both worlds: $O(K \log T)$ bounds without restrictive assumptions.
研究动机与目标
- 解决现有对弈老虎机算法依赖Condorcet胜者这一局限,而该胜者在实际中可能不存在。
- 在无Condorcet胜者的情况下提供遗憾界,这是信息检索与在线A/B测试等实际应用中的常见问题。
- 设计在理论严谨性与实际可扩展性之间平衡的算法,其中一种针对小$K$优化,另一种针对大规模问题。
- 通过结合现有方法的最优特性,实现比以往方法更紧的遗憾界:$\mathcal{O}(K\log T)$的遗憾界,且无需限制性假设。
提出的方法
- 提出柯珀兰置信上界(CCB),一种受UCB启发的算法,利用配对胜率的上下置信界来识别柯珀兰得分高的臂。
- 引入可扩展柯珀兰老虎机(SCB),一种更高效的变体,通过聚焦于具有高潜力成为柯珀兰胜者的臂的采样策略,减少遗憾界中的$\mathcal{O}(K^2)$项。
- 将柯珀兰得分定义为某臂击败其他臂的数量,并以此作为无Condorcet胜者时识别最优臂的主要指标。
- 应用高概率浓度不等式与置信区间,以限制估计误差并确保收敛至真实的柯珀兰胜者。
- 基于$C(\delta)$设计阈值机制,确保早期阶段充分探索,平衡探索与利用。
- 利用配对比较的结构与胜败关系的对称性,减少冗余比较,提升样本效率。
实验结果
研究问题
- RQ1我们能否设计出在不假设存在Condorcet胜者的情况下,实现$\mathcal{O}(K\log T)$遗憾界的对弈老虎机算法?
- RQ2当无单一臂完全主导其他所有臂时,如何高效识别柯珀兰胜者——即击败最多其他臂的臂?
- RQ3在大规模对弈老虎机问题中,遗憾性能与计算可扩展性之间的权衡是什么?
- RQ4我们能否在保持强理论保证的前提下,消除遗憾界中的$\mathcal{O}(K^2)$加法项?
- RQ5在信息检索等实际场景中,所提算法与现有方法相比的实证表现如何?
主要发现
- CCB实现了$\mathcal{O}(K^2 + K\log T)$的任意时间高概率遗憾界,其对间隙$\Delta_{ij} = |p_{ij} - 0.5|$的依赖显著优于以往方法。
- SCB实现了$\mathcal{O}(K\log K\log T)$的期望遗憾界,消除了$\mathcal{O}(K^2)$项,从而实现对大规模$K$的可扩展性。
- 两种算法的遗憾界均为$\mathcal{O}(K\log T}$量级,与在Condorcet假设下已知的最佳结果一致,但无需该假设。
- 在信息检索数据集上的实证评估表明,CCB与SCB在非Condorcet场景下优于现有方法,性能与理论预测一致。
- 当$K$较小时且臂之间区分明显时,CCB表现更优;而SCB因遗憾界更紧,在大规模场景中表现更佳。
- 本文证明了随着$K$增大,Condorcet胜者存在的概率迅速下降,从而验证了在实践中采用CCB与SCB类算法的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。