Skip to main content
QUICK REVIEW

[论文解读] Competing Bandits in Matching Markets

Lydia T. Liu, Horia Mania|arXiv (Cornell University)|Jun 12, 2019
Advanced Bandit Algorithms Research参考文献 29被引用 8
一句话总结

本文提出了一种竞争性赌徒模型,应用于双边匹配市场,其中一方通过随机奖励学习偏好,将多臂赌博机扩展至包含臂偏好和竞争的场景。该文提出了集中式与分布式版本的ETC和UCB算法,证明了问题相关的遗憾界为O(log n),并表明集中式UCB具有激励相容性,确保在不确定性下实现稳定且高效的市场结果。

ABSTRACT

Stable matching, a classical model for two-sided markets, has long been studied with little consideration for how each side's preferences are learned. With the advent of massive online markets powered by data-driven matching platforms, it has become necessary to better understand the interplay between learning and market objectives. We propose a statistical learning model in which one side of the market does not have a priori knowledge about its preferences for the other side and is required to learn these from stochastic rewards. Our model extends the standard multi-armed bandits framework to multiple players, with the added feature that arms have preferences over players. We study both centralized and decentralized approaches to this problem and show surprising exploration-exploitation trade-offs compared to the single player multi-armed bandits setting.

研究动机与目标

  • 建模通过重复随机互动学习偏好的双边市场,捕捉现实世界中的在线劳动力与服务平台。
  • 形式化学习(赌博机)与市场稳定性(匹配)之间的相互作用,尤其在竞争与不确定性下的表现。
  • 开发在最小化探索-利用权衡遗憾的同时实现稳定匹配结果的算法。
  • 分析在臂具有偏好且仅最偏好代理获得奖励的多智能体环境中,遗憾的表现。
  • 为集中式与分布式学习协议建立关于遗憾与稳定性的理论保证。

提出的方法

  • 将探索-然后-承诺(ETC)算法扩展至具有臂偏好的多智能体赌博机,采用两阶段过程:探索后进入利用阶段。
  • 提出一种集中式UCB变体,整合臂偏好并维持稳定性,通过调整置信区间以适应竞争环境。
  • 定义两种遗憾度量——代理最优与市场最优——基于稳定匹配,以量化学习低效性。
  • 使用概率浓度不等式,边界化去中心化ETC中的碰撞与奖励估计误差,尤其针对稀有臂。
  • 应用Gumbel-Max表示法,在不确定性下建模稳定匹配结果,将赌博机遗憾与匹配稳定性联系起来。
  • 证明集中式UCB具有激励相容性,即代理在算法下有动机真实报告偏好。

实验结果

研究问题

  • RQ1多臂赌博机学习如何适应双边市场,其中臂(如资源或雇主)对代理有偏好?
  • RQ2在具有臂偏好与碰撞约束的竞争性多智能体赌博机设置中,可实现何种遗憾界?
  • RQ3集中式与去中心化算法能否在最小化探索遗憾的同时实现稳定的市场结果?
  • RQ4一方偏好中的不确定性如何影响整个市场的长期效用与稳定性?
  • RQ5能否设计出在不确定性下收敛至稳定匹配的激励相容学习算法?

主要发现

  • 去中心化ETC算法对每个代理实现O(log n)问题相关遗憾,其界依赖于玩家数量、臂数量及偏好重叠程度。
  • 集中式UCB实现O(log n)问题相关遗憾,并被证明具有激励相容性,确保在稳定匹配中真实报告偏好。
  • 去中心化ETC的遗憾界包含随探索时间H衰减的指数项,反映成功选择臂的概率。
  • 该模型表明,一方的不确定性会降低其他代理的长期效用,凸显学习中的战略外部性。
  • 集中式UCB算法快速收敛至稳定匹配配置,在遗憾与稳定性保障方面均优于ETC。
  • 结果可推广至臂偏好不确定的场景,尽管本文为简化起见聚焦于已知臂偏好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。