[论文解读] Fairness of Exposure in Stochastic Bandits
本文提出 FairX bandit 框架,以解决随机多臂老虎机和线性 bandit 中的曝光分配公平性问题,确保各臂获得与其能力成比例的曝光。该框架引入了公平性遗憾和奖励遗憾目标,并开发了公平 UCB 和 Thompson Sampling 算法,在合成数据集和真实世界数据集中均实现了次线性遗憾边界,同时保证了基于能力的公平性。
Contextual bandit algorithms have become widely used for recommendation in online systems (e.g. marketplaces, music streaming, news), where they now wield substantial influence on which items get exposed to the users. This raises questions of fairness to the items -- and to the sellers, artists, and writers that benefit from this exposure. We argue that the conventional bandit formulation can lead to an undesirable and unfair winner-takes-all allocation of exposure. To remedy this problem, we propose a new bandit objective that guarantees merit-based fairness of exposure to the items while optimizing utility to the users. We formulate fairness regret and reward regret in this setting, and present algorithms for both stochastic multi-armed bandits and stochastic linear bandits. We prove that the algorithms achieve sub-linear fairness regret and reward regret. Beyond the theoretical analysis, we also provide empirical evidence that these algorithms can fairly allocate exposure to different arms effectively.
研究动机与目标
- 解决传统 bandit 算法中存在的赢家通吃曝光问题,该问题不公平地偏爱高奖励臂。
- 通过确保每条臂的曝光与其能力成比例来形式化曝光分配的公平性,其中能力被定义为均值奖励的递增函数。
- 在 bandit 学习中引入并分析公平性遗憾和奖励遗憾作为双重目标。
- 为随机多臂和线性 bandit 设计并理论分析公平 UCB 和 Thompson Sampling 算法。
- 通过实证验证,所提出的算法在保持低奖励遗憾的同时实现了公平的曝光分配。
提出的方法
- 将能力定义为臂的均值奖励的递增函数,将曝光定义为在 bandit 策略下被选择的概率。
- 将公平性遗憾定义为实际曝光与按能力成比例的曝光之间的偏差,将奖励遗憾定义为与最优用户效用之间的偏差。
- 设计一种公平 UCB 算法,通过基于能力与曝光差异的公平感知置信区间调整来实现。
- 设计一种公平 Thompson Sampling 算法,从经过调整的后验分布中采样,以维持期望曝光的公平性。
- 通过线性模型和岭回归进行参数估计,将公平 UCB 和 TS 框架扩展到随机线性 bandit 设置。
- 对所有算法使用网格搜索进行超参数调优,包括探索权重、先验方差和正则化项。
实验结果
研究问题
- RQ1能否设计一种 bandit 算法,在最大化用户效用的同时确保按臂的能力成比例的公平曝光分配?
- RQ2在所提出的 FairX bandit 框架中,公平性和奖励的理论遗憾边界可以证明为何种形式?
- RQ3与传统 bandit 相比,公平感知算法在曝光公平性和用户响应优化方面表现如何?
- RQ4在线性 bandit 中模型误设是否会影响公平性遗憾的收敛性?如何缓解此问题?
- RQ5公平感知算法是否能在多样化的现实世界和合成数据集中保持次线性公平性和奖励遗憾?
主要发现
- 所提出的公平 UCB 和公平 TS 算法在随机多臂和线性 bandit 设置中均实现了次线性公平性遗憾和奖励遗憾。
- 公平性遗憾依赖于臂的最小能力以及能力函数的利普希茨常数,且已推导出理论下界。
- 在酿酒酵母和 mediamill 数据集上的实证结果表明,FairX 算法能有效控制基于能力的公平性,同时保持低奖励遗憾。
- 在 Yahoo! 数据集上,即使在 5 天窗口上进行超参数调优并在接下来的 5 天进行测试,FairX 算法仍保持了稳健的公平性和低遗憾。
- 在模型设定正确的线性模型设置下(来自酿酒酵母的合成数据),公平性遗憾如理论预测的那样收敛,遵循 √T 规模,证实了理论边界。
- 尽管理论遗憾边界相似,实际中基于 TS 的算法相比基于 UCB 的算法表现出计算上的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。