Skip to main content
QUICK REVIEW

[论文解读] Efficient Resource Allocation with Fairness Constraints in Restless Multi-Armed Bandits

De-Xun Li, Pradeep Varakantham|arXiv (Cornell University)|Jun 8, 2022
Advanced Bandit Algorithms Research被引用 4
一句话总结

本文提出了一种针对非休息性多臂老虎机(RMAB)的公平性约束方法,以确保在公共卫生和资源有限的环境中,各臂之间的干预分配更加公平。该方法引入了一种基于自上次激活以来最大时间的新型公平性约束,对Whittle指数算法进行了修改,以在保证公平性的同时实现可扩展性和最优性,并评估了基于模型和无模型的学习方法,结果表明在不显著降低预期奖励性能的前提下,可以有效实施公平性约束。

ABSTRACT

Restless Multi-Armed Bandits (RMAB) is an apt model to represent decision-making problems in public health interventions (e.g., tuberculosis, maternal, and child care), anti-poaching planning, sensor monitoring, personalized recommendations and many more. Existing research in RMAB has contributed mechanisms and theoretical results to a wide variety of settings, where the focus is on maximizing expected value. In this paper, we are interested in ensuring that RMAB decision making is also fair to different arms while maximizing expected value. In the context of public health settings, this would ensure that different people and/or communities are fairly represented while making public health intervention decisions. To achieve this goal, we formally define the fairness constraints in RMAB and provide planning and learning methods to solve RMAB in a fair manner. We demonstrate key theoretical properties of fair RMAB and experimentally demonstrate that our proposed methods handle fairness constraints without sacrificing significantly on solution quality.

研究动机与目标

  • 为解决RMAB中因奖励最大化策略而导致某些臂(例如弱势群体)长期被忽视的干预饥饿问题。
  • 在RMAB中形式化一种公平性约束,确保每个臂或每类臂在上次激活后的有限时间窗口内至少被激活一次。
  • 开发一种可扩展且最优的基于Whittle指数的算法,适用于有限和无限时域的RMAB问题,并满足公平性约束。
  • 提出一种无模型强化学习方法(使用Thompson采样和Q-learning),在转移概率未知时实现公平RMAB。
  • 通过实证验证,公平性约束可在不显著降低预期奖励性能的前提下被有效实施。

提出的方法

  • 提出一种基于最大时间间隔 $ L $ 的公平性约束,即若某臂在 $ L-1 $ 步内未被激活,则必须在第 $ L $ 步被选择,以确保最低激活频率。
  • 通过在索引计算中引入与上次激活以来时间相关的惩罚项,对Whittle指数算法进行修改,以整合公平性约束。
  • 基于信念状态MDP,推导出在公平性约束下最优动作选择的条件,其中信念状态根据被动转移和动作结果演变。
  • 提出一种无模型学习方法,结合Thompson采样和Q-learning,以在转移概率未知时估计Whittle索引,从而实现在现实场景中的应用。
  • 采用部分可观察MDP框架,其中信念状态基于历史动作和观测结果进行更新,公平性触发的激活被建模为信念链的头部转移。
  • 基于Liu和Zhao(2010)的工作,采用基于值函数近似的算法,以在公平性约束下计算未来预期奖励。

实验结果

研究问题

  • RQ1是否可以在RMAB中正式定义公平性约束,以防止某些臂或群体长期被忽视?
  • RQ2如何对Whittle指数算法进行改进,以在保持最优性和可扩展性的同时强制执行公平性约束?
  • RQ3在RMAB设置中,强制执行公平性约束对预期奖励性能的退化程度如何?
  • RQ4当转移动态未知时,无模型强化学习方法是否能有效学习公平策略?
  • RQ5不同强度的公平性约束(例如,不同的 $ L $ 和 $ \eta $)如何影响公平性与奖励之间的权衡?

主要发现

  • 所提出的公平性约束确保了没有任何臂会因缺乏干预而被剥夺,与标准Whittle指数相比,最多有50%的臂在无公平性约束下未被激活,而公平策略下则实现了持续激活。
  • 修改后的Whittle指数算法保持了高质量的解,在所有测试的公平性约束水平下,平均奖励均接近非公平基线的最优值。
  • 对于强公平性约束($ L $ 满足 $ kL/N = 1.3 $),该方法仍能实现超过85%的最优奖励,表明性能损失极小。
  • 无模型学习方法(Thompson采样和Q-learning)成功近似了Whittle索引并实现了公平性,其性能与基于模型的方法相当。
  • 该方法在所有干预水平($ k/N = 5\%, 10\%, 20\%, 30\% $)下均持续优于随机策略和短视基线,即使在严格的公平性约束下亦是如此。
  • 公平性约束强度(由 $ L $ 和 $ \eta $ 控制)允许在公平性与效率之间进行可调权衡,低强度约束($ kL/N = 3 $)导致性能退化最小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。