Skip to main content
QUICK REVIEW

[论文解读] Fairness with Dynamics.

Min Wen, Osbert Bastani|arXiv (Cornell University)|Jan 24, 2019
Reinforcement Learning in Robotics参考文献 18被引用 12
一句话总结

本文通过将反馈效应建模为马尔可夫决策过程(MDPs),解决了决策中公平性约束可能随时间推移加剧不公平性的风险。本文提出了公平感知的MDP算法和强化学习方法,以在时间上保持公平性,并通过模拟表明,忽略动态特性会导致贷款审批场景中不公平性增加。

ABSTRACT

It has recently been shown that if feedback effects of decisions are ignored, then imposing fairness constraints such as demographic parity or equality of opportunity can actually exacerbate unfairness. We propose to address this challenge by modeling feedback effects as the dynamics of a Markov decision processes (MDPs). First, we define analogs of fairness properties that have been proposed for supervised learning. Second, we propose algorithms for learning fair decision-making policies for MDPs. We also explore extensions to reinforcement learning, where parts of the dynamical system are unknown and must be learned without violating fairness. Finally, we demonstrate the need to account for dynamical effects using simulations on a loan applicant MDP.

研究动机与目标

  • 解决静态公平性约束在机器学习中可能因忽略随时间的反馈效应而加剧不公平性的问题。
  • 在马尔可夫决策过程(MDPs)框架内形式化公平性属性,如人口均等和机会均等。
  • 开发用于在MDPs中学习公平决策策略的算法,以考虑长期反馈动态。
  • 将该方法扩展到强化学习设置,其中环境部分未知,必须在不违反公平性的情况下进行学习。
  • 通过模拟贷款审批过程,在不同公平性和反馈假设下,实证验证建模动态的必要性。

提出的方法

  • 在MDPs中形式化公平性约束——人口均等和机会均等——作为动态属性,使其适应随时间变化的状态和动作分布。
  • 为MDPs开发策略学习算法,通过约束优化技术在保持决策质量的同时优化长期公平性。
  • 通过修改Q-learning或策略梯度方法,将公平性约束整合到强化学习中,以惩罚不公平的状态-动作转移。
  • 将决策与状态演化之间的反馈回路建模为随机转移过程,其中决策影响未来的状态分布和公平性度量。
  • 使用值迭代或策略迭代的扩展方法,在动态约束下计算公平策略,确保在多个决策步骤中保持公平性。
  • 模拟一个具有反馈动态的贷款审批MDP,比较静态公平性约束与动态公平感知策略下的结果。

实验结果

研究问题

  • RQ1为静态监督学习设计的公平性约束在忽略随时间的反馈效应时,是否会导致不公平性增加?
  • RQ2如何将人口均等和机会均等等公平性属性适应到建模为MDPs的动态决策设置中?
  • RQ3哪些算法方法能够在考虑长期反馈效应的同时,实现MDPs中公平策略的学习?
  • RQ4在环境动态未知的强化学习环境中,公平感知策略的性能与静态公平性约束相比如何?
  • RQ5在公平决策系统中忽略反馈动态的长期后果是什么?

主要发现

  • 在公平性约束中忽略反馈效应会导致不公平性随时间显著增加,即使初始决策是公平的。
  • 所提出的动态公平框架在贷款审批MDP模拟中成功地在多个决策步骤中保持了公平性度量。
  • 公平感知MDP策略在长期保持人口均等和机会均等方面优于静态公平性约束。
  • 强化学习扩展方法在环境动态部分未知的情况下,仍能保持公平性。
  • 模拟表明,若未显式建模和约束,反馈回路会放大初始不平等。
  • 动态方法可防止因未考虑决策长期社会影响而导致的公平性退化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。