[论文解读] Beyond $\log^2(T)$ Regret for Decentralized Bandits in Matching Markets
该论文提出了一种针对单面反馈两阶段匹配市场的去中心化多臂赌博机算法,一般市场下实现 $O(K\log^{1+\varepsilon}(T))$ 的遗憾,唯一性一致性条件下实现 $O(NK\log T)$ 的遗憾,优于以往的 $O(\log^2 T)$ 和 $O(\exp(N^4)\log^2 T)$ 边界。该方法采用基于阶段的探索策略,结合全局与局部动作删除,以解决冲突与排名异质性问题。
We design decentralized algorithms for regret minimization in the two-sided matching market with one-sided bandit feedback that significantly improves upon the prior works (Liu et al. 2020a, 2020b, Sankararaman et al. 2020). First, for general markets, for any $\varepsilon > 0$, we design an algorithm that achieves a $O(\log^{1+\varepsilon}(T))$ regret to the agent-optimal stable matching, with unknown time horizon $T$, improving upon the $O(\log^{2}(T))$ regret achieved in (Liu et al. 2020b). Second, we provide the optimal $Θ(\log(T))$ agent-optimal regret for markets satisfying uniqueness consistency -- markets where leaving participants don't alter the original stable matching. Previously, $Θ(\log(T))$ regret was achievable (Sankararaman et al. 2020, Liu et al. 2020b) in the much restricted serial dictatorship setting, when all arms have the same preference over the agents. We propose a phase-based algorithm, wherein each phase, besides deleting the globally communicated dominated arms the agents locally delete arms with which they collide often. This local deletion is pivotal in breaking deadlocks arising from rank heterogeneity of agents across arms. We further demonstrate the superiority of our algorithm over existing works through simulations.
研究动机与目标
- 设计去中心化算法,在单面赌博机反馈下,实现两阶段匹配市场中代理最优的稳定匹配,并获得改进的遗憾边界。
- 克服以往工作在完全去中心化设置下仅能达到代理最差或次优遗憾的局限性。
- 通过引入局部动作删除,解决去中心化赌博机学习中的排名异质性与冲突死锁问题。
- 在理论与实验上证明所提算法相较于 CA-UCB 和 UCB-D3 等现有方法的优越性。
- 在唯一性一致性条件下建立最优遗憾边界,突破以往仅限于串行独裁假设的局限。
提出的方法
- 提出一种基于阶段的探索-然后-承诺协议(Phased ETC),其中代理在各阶段探索动作,并利用估计的偏好选择稳定匹配。
- 引入基于局部冲突的动作删除机制:代理删除频繁发生冲突的动作,以减少干扰并解决由排名异质性引发的死锁。
- 通过全局通信删除所有代理中的劣质动作,与局部删除协同,提升探索效率。
- 在每个阶段使用上置信界(UCB)索引,以平衡探索与利用。
- 设计 UCB-D4 作为 UCB-D3 的扩展,引入局部删除机制以处理异质动作排名,提升遗憾性能。
- 通过指数增长($c_0^{i}$)和乘数调节阶段长度,以在大规模实例中平衡早期遗憾与收敛速度。
实验结果
研究问题
- RQ1去中心化多臂赌博机算法能否在一般两阶段匹配市场与单面反馈下实现亚 $\log^2 T$ 遗憾?
- RQ2在超越串行独裁假设的去中心化设置中,能否实现最优的 $O(NK\log T)$ 遗憾?
- RQ3在代理对动作的排名存在异质性的市场中,基于局部冲突的删除机制如何提升性能?
- RQ4唯一性一致性对去中心化赌博机匹配中的遗憾边界与算法设计有何影响?
- RQ5基于阶段的探索策略,结合自适应阶段长度与局部删除,能否在理论与仿真中均优于 CA-UCB 和 UCB-D3 等现有算法?
主要发现
- 所提出的 Phased ETC 算法在一般市场中实现 $O(K\log^{1+\varepsilon}(T))$ 的遗憾,对任意 $\varepsilon > 0$ 成立,优于 CA-UCB 的 $O(\exp(N^4)\log^2 T)$ 边界。
- 在唯一性一致性条件下,UCB-D4 实现 $O(NK\log T)$ 遗憾,与此前仅在串行独裁设定下已知的最优边界一致。
- 仿真结果表明,即使在无唯一性一致性假设的一般实例中,UCB-D4 也能实现次线性遗憾,暗示其理论边界可能超越当前分析范围。
- CA-UCB 尽管获得额外反馈,仍面临高冲突遗憾,表明在去中心化设置中,冲突解决是遗憾的主要驱动因素。
- 采用指数增长($c_0 = 1.5$ 用于 Phased ETC,$c_0 = 1.2$ 用于 UCB-D4)的调优阶段长度显著降低早期遗憾,并提升大规模实例($N=11$,$K=15$)下的收敛性能。
- UCB-D4 的通信遗憾被限制在 $(K-1+|\mathcal{B}_{jk^*}|)\log_{c_0}(T/c_1)$ 以内,表明局部删除可降低通信开销与遗憾。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。