Skip to main content
QUICK REVIEW

[论文解读] Algorithms for Fairness in Sequential Decision Making

Min Wen, Osbert Bastani|arXiv (Cornell University)|Jan 24, 2019
Economic Policies and Impacts被引用 17
一句话总结

本文通过将反馈效应建模为马尔可夫决策过程(MDP),提出了在序列决策设置中学习公平决策策略的算法。在MDP框架内引入了公平性约束——代表性公平与机会均等,并表明忽略动态特性会导致不公平结果,而所提出的基于模型与无模型的算法在公平性-性能权衡上优于假设无反馈效应或最坏情况动态的基线方法。

ABSTRACT

It has recently been shown that if feedback effects of decisions are ignored, then imposing fairness constraints such as demographic parity or equality of opportunity can actually exacerbate unfairness. We propose to address this challenge by modeling feedback effects as Markov decision processes (MDPs). First, we propose analogs of fairness properties for the MDP setting. Second, we propose algorithms for learning fair decision-making policies for MDPs. Finally, we demonstrate the need to account for dynamical effects using simulations on a loan applicant MDP.

研究动机与目标

  • 解决在序列决策中忽略反馈效应时,静态学习中的公平性约束可能加剧不公平性的问题。
  • 将公平性定义(如代表性公平与机会均等)扩展至具有动态反馈的马尔可夫决策过程(MDP)设置。
  • 开发实用的算法,以在考虑状态转移与决策长期后果的同时学习公平策略。
  • 通过实证结果证明,即使施加了公平性约束,忽略动态特性仍会导致不公平策略。

提出的方法

  • 将序列决策中的反馈效应建模为马尔可夫决策过程(MDP),其中状态表示个体属性的动态演变,动作表示决策(例如贷款审批)。
  • 在MDP中引入特定的公平性约束:代表性公平与机会均等,定义为在时间维度上对不同子群体(如多数群体与少数群体)的平均结果进行均衡化。
  • 提出一种基于模型的算法,在有限状态/动作空间和敏感属性不随时间变化的可分性假设下,具备最优性保证。
  • 开发一种无模型算法,适用于一般MDP,尽管缺乏最优性保证,但具备更广泛的应用潜力。
  • 采用约束MDP技术,在公平性约束下优化策略,明确区分决策者奖励(如银行利润)与个体结果。
  • 采用保守基线(假设最坏情况对抗性状态转移)与乐观基线(假设无反馈效应)进行性能对比。

实验结果

研究问题

  • RQ1在序列决策中,若忽略反馈效应,静态学习中的公平性约束是否会导致更差的结果?
  • RQ2如何在具有动态状态转移的MDP框架中,有意义地扩展代表性公平与机会均等等公平性属性?
  • RQ3与忽略反馈效应的算法相比,考虑反馈效应的算法在性能与公平性之间的权衡如何?
  • RQ4在最优性与实用性方面,MDP中学习公平策略的基于模型与无模型方法有何差异?
  • RQ5忽略动态特性对公平性的影响如何,以约束违反程度与奖励损失衡量?

主要发现

  • 乐观基线(假设无反馈效应,类比监督学习)在代表性公平上的公平性约束违反值为0.14,显著高于所提算法的0.10。
  • 保守基线(假设最坏情况对抗性动态)实现了完美公平性(约束值为0),但导致严重奖励损失,从10.43降至10.00。
  • 所提基于模型的算法在代表性公平上实现0.10的约束违反值,同时保持10.40的高奖励,优于两个基线在公平性-奖励权衡上的表现。
  • 在机会均等方面,所提算法实现0.10的约束违反值,与乐观基线(0.11)相近,但显著优于无种族偏见策略(0.37)。
  • 无种族偏见策略(忽略敏感属性)获得最高奖励(10.43),但在公平性约束上表现最差,凸显了在动态环境中静态公平性方法的风险。
  • 结果表明,考虑动态特性至关重要:即使显式施加了公平性约束,忽略动态特性仍会导致不公平策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。