[论文解读] Near-Optimal Collaborative Learning in Bandits
该论文提出了一种在加权多智能体 bandit 设置下用于协作最优臂识别的近优算法,其中每个智能体旨在寻找具有最高期望混合奖励的臂——该混合奖励被定义为所有智能体本地奖励的加权平均。该方法采用分阶段消除策略,并结合数据依赖的采样方案,以最小化样本复杂度,同时保持较低的通信成本,实现了在对数因子范围内的近优性能。
This paper introduces a general multi-agent bandit model in which each agent is facing a finite set of arms and may communicate with other agents through a central controller in order to identify, in pure exploration, or play, in regret minimization, its optimal arm. The twist is that the optimal arm for each agent is the arm with largest expected mixed reward, where the mixed reward of an arm is a weighted sum of the rewards of this arm for all agents. This makes communication between agents often necessary. This general setting allows to recover and extend several recent models for collaborative bandit learning, including the recently proposed federated learning with personalization (Shi et al., 2021). In this paper, we provide new lower bounds on the sample complexity of pure exploration and on the regret. We then propose a near-optimal algorithm for pure exploration. This algorithm is based on phased elimination with two novel ingredients: a data-dependent sampling scheme within each phase, aimed at matching a relaxation of the lower bound.
研究动机与目标
- 解决多智能体 bandit 框架下的协作最优臂识别问题,其中智能体通过共享的加权混合奖励函数进行优化。
- 在纯探索中最小化样本复杂度,同时保持智能体之间的低通信成本。
- 推广并扩展近期模型,如带有个性化和协作 bandit 学习的联邦多臂 bandit 模型。
- 推导协作设置下样本复杂度和遗憾的新型理论下界。
- 设计并评估一种渐近匹配理论边界的近优算法。
提出的方法
- 引入一种加权协作 bandit 模型,其中每个智能体的奖励是所有智能体本地奖励的凸组合,由已知的权重矩阵 W 定义。
- 提出一种分阶段消除算法(W-CPE-BAI),根据估计的期望混合奖励差距动态分配样本。
- 在每个阶段内引入数据依赖的采样方案,以匹配样本复杂度理论下界的一个松弛版本。
- 使用基于优化的预言机计算理想采样分配,作为算法性能的基准。
- 采用中心控制器协调通信,使智能体能够共享经验均值,从而改进对混合奖励的估计。
- 使用 CVXPY 和 MOSEK 求解预言机计算中的底层优化问题,并进行数值稳定性检查。
实验结果
研究问题
- RQ1在加权混合奖励模型下,协作最优臂识别的根本样本复杂度极限是什么?
- RQ2智能体如何在保持高置信度识别最优臂的同时最小化探索成本?
- RQ3通信高效的算法能否在样本复杂度上实现近优性能,仅在对数因子范围内?
- RQ4通过权重矩阵 W 实现的个性化如何影响探索与通信之间的权衡?
- RQ5当置信度水平 δ 趋近于零时,算法性能的缩放行为如何?
主要发现
- 所提出的 W-CPE-BAI 算法相比 PF-UCB-BAI 基线显著降低了通信成本,尤其在个性化程度增加时(α → 1)。
- 当 α = 0.7 时,W-CPE-BAI 使用 10 次通信轮次,与 PF-UCB-BAI 相同,但探索成本降低 15%(45,765 vs. 55,812 次采样)。
- 实际探索成本与理论下界(c*/T*)的比值从 δ=0.1 时的 68.0 降低至 δ=0.00001 时的 11.9,表明具有强渐近缩放性能。
- 该算法在样本复杂度上实现了近优性能,c*/T* 比值随 δ → 0 而减小,与理论上的上界一致。
- 当 Δ′_min 太小时,预言机计算中出现数值不稳定性,表明在困难实例中需要更稳健的在线优化方法。
- 所有算法在五位小数范围内均达到零错误率(δ̂ = 0),表明在识别最优臂方面具有高度可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。