Skip to main content
QUICK REVIEW

[论文解读] Fairness in Reinforcement Learning

Paul Weng|arXiv (Cornell University)|Jul 24, 2019
Reinforcement Learning in Robotics参考文献 28被引用 14
一句话总结

本文提出通过使用社会福利函数——特别是广义基尼指数(GGI)——将公平性整合到强化学习中,以优化在多个利益相关者之间平衡效率与公平性的策略。该方法将DQN算法改进为同时最小化平均等待时间并提升交通灯控制中的公平性,结果显示,GGI-DQN方法在平均延迟略高的情况下,显著改善了各车道等待时间分布的公平性,优于标准DQN。

ABSTRACT

Decision support systems (e.g., for ecological conservation) and autonomous systems (e.g., adaptive controllers in smart cities) start to be deployed in real applications. Although their operations often impact many users or stakeholders, no fairness consideration is generally taken into account in their design, which could lead to completely unfair outcomes for some users or stakeholders. To tackle this issue, we advocate for the use of social welfare functions that encode fairness and present this general novel problem in the context of (deep) reinforcement learning, although it could possibly be extended to other machine learning tasks.

研究动机与目标

  • 解决影响多个利益相关者的决策支持与自主系统中缺乏公平性考量的问题。
  • 提出一种新颖的框架,利用编码公平性的社会福利函数实现公平的序列决策,尤其在强化学习中。
  • 通过使用标量福利函数从帕累托前沿中选择单一公平解,克服帕累托优化的局限性。
  • 展示在真实世界的序列决策任务(如交通灯控制)中,公平优化的可行性和优势。
  • 扩展深度强化学习,引入兼顾效率与公平性的公平感知目标,实现用户间的平衡。

提出的方法

  • 将公平的序列决策问题建模为非线性凸优化问题,目标是最大化基于公平性的福利函数,该函数以用户/利益相关者的效用为基础。
  • 使用广义基尼指数(GGI)作为编码公平性的福利函数,定义为有序效用的加权和,权重递减以强调较低效用。
  • 将GGI应用于策略的多目标价值函数,将原始强化学习目标转化为标量、拟凹函数,以促进公平性。
  • 对深度Q网络(DQN)算法进行改进,以在GGI目标下近似最优策略,实现深度强化学习中的端到端训练。
  • 在损失函数中引入重加权机制,优先最小化利益相关者之间效用差异,以优化学习过程。
  • 利用GGI的Schur-凹性与可分解性,保持序列决策中理想的优化特性。

实验结果

研究问题

  • RQ1如何在不牺牲整体系统效率的前提下,系统性地将公平性整合到强化学习中?
  • RQ2像基尼指数这样的单一标量福利函数,能否有效引导多利益相关者环境中的策略学习,实现公平结果?
  • RQ3在交通控制系统中,最小化平均等待时间与确保公平性之间存在何种权衡?
  • RQ4与标准DQN相比,基于GGI的目标在序列决策中的公平性与平均性能表现如何?
  • RQ5现有深度强化学习算法在多大程度上可被修改,以通过非线性福利函数实现公平性优化?

主要发现

  • GGI-DQN方法的平均等待时间略高(427.05个时间步),相较于标准DQN(420.72个时间步),证实了效率与公平性之间的权衡。
  • 尽管平均延迟较高,GGI-DQN显著改善了全部8条车道等待时间分布的公平性,降低了车道间的差异。
  • 标准DQN在等待时间上表现出高度不平等,部分车道的延迟远高于其他车道。
  • 所提出的方法通过GGI的加权机制优先考虑较低效用,成功平衡了利益相关者的福利。
  • 结果表明,通过GGI实现的公平感知优化可有效集成到深度强化学习中,实现在复杂真实环境中的公平结果。
  • 该方法具有通用性,可推广至交通控制之外的其他多智能体或多利益相关者序列决策问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。