Skip to main content
QUICK REVIEW

[论文解读] Fair Algorithms for Infinite and Contextual Bandits

Matthew Joseph, Michael Kearns|arXiv (Cornell University)|Oct 29, 2016
Advanced Bandit Algorithms Research被引用 12
一句话总结

本文提出了一种新颖的框架,用于无限和上下文线性 bandit 问题中的 meritocratic 公平性,可在不依赖群体成员身份信息的情况下实现公平选择。通过使用置信区间确保不会偏好资格较低的个体,作者获得了实例相关的遗憾界,其紧致性仅在对数因子范围内,相较于以往工作在一般性和公平性约束下的性能保证方面均有显著提升。

ABSTRACT

We study fairness in linear bandit problems. Starting from the notion of meritocratic fairness introduced in Joseph et al. [2016], we carry out a more refined analysis of a more general problem, achieving better performance guarantees with fewer modelling assumptions on the number and structure of available choices as well as the number selected. We also analyze the previously-unstudied question of fairness in infinite linear bandit problems, obtaining instance-dependent regret upper bounds as well as lower bounds demonstrating that this instance-dependence is necessary. The result is a framework for meritocratic fairness in an online linear setting that is substantially more powerful, general, and realistic than the current state of the art.

研究动机与目标

  • 解决在不确定性在线决策中存在公平性问题,特别是在标准 no-regret 算法可能系统性地损害更高资格个体的场景中。
  • 通过引入与群体无关的公平性定义,放宽以往工作中对固定群体结构和每轮仅选择一个个体的限制性假设。
  • 为有限和无限线性 bandit 设置开发公平算法,涵盖多选和无限选择场景。
  • 建立实例相关的遗憾界,并通过下界证明其必要性。
  • 表明公平性约束从根本上改变了无限 bandit 问题中的遗憾格局,因此需要实例相关的分析。

提出的方法

  • 通过 meritocratic 准则定义公平性:算法不得赋予资格较低的个体高于资格较高的个体的更高选择概率。
  • 利用估计奖励的置信区间来确定选择资格,通过认证更高奖励选项确实更优来确保公平性。
  • 通过利用最优解位于可行域极值点的事实,将基于置信区间的框架适配至无限线性 bandit 问题。
  • 证明遗憾界依赖于 Δ_gap,即选择集中最佳与次佳极值点之间的距离,该距离捕捉了实例特定的难度。
  • 建立下界以证明在无限设置下,实例依赖性对公平算法是必要的,从而证明上界具有紧致性。
  • 通过在可行集上使用归纳法和拓扑论证,证明当公平性约束紧密时,公平算法必须在特定子集上均匀选择。

实验结果

研究问题

  • RQ1是否可以在不假设群体成员身份或固定群体结构的前提下,在线性 bandit 中强制实现公平性?
  • RQ2在无限线性 bandit 问题中,公平算法的遗憾的根本极限是什么?
  • RQ3选择集的结构——特别是最优与次优极值点之间的距离——如何影响公平学习的性能?
  • RQ4在无限 bandit 问题中,公平算法是否必须依赖实例相关的遗憾界,还是可以实现统一的界限?
  • RQ5能否为多选和无限选择场景设计公平算法,同时保持强遗憾保证?

主要发现

  • 所提出的公平算法在无限线性 bandit 问题中实现了与 Δ_gap(选择集中最佳与次佳极值点之间的差距)相关的遗憾界,其性能随 Δ_gap 缩放。
  • 建立了下界,证明任何公平算法的遗憾必须以 Δ_gap 的多项式形式依赖,从而证明实例依赖性是必要的,且上界近乎紧致。
  • 该框架无需知晓群体成员身份,因此可应用于任意、无结构的个体群体。
  • 实验表明,标准 UCB 风格算法在 10,000 轮内可能导致近 400 次误判,而所提出的 FairUCB 在保持最小遗憾的同时维持了公平性。
  • 在特征相关的情境中,UCB 由于置信区间不确定性更高,会不成比例地误判多数群体,凸显了一种反直觉的公平性失败。
  • 本文证明,若不对选择集施加结构假设,则不存在具有非平凡遗憾保证的公平算法,从而证明了其假设的合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。