Skip to main content
QUICK REVIEW

[论文解读] Learning Fair Policies in Multiobjective (Deep) Reinforcement Learning with Average and Discounted Rewards

Umer Siddique, Paul Weng|arXiv (Cornell University)|Aug 18, 2020
Reinforcement Learning in Robotics被引用 13
一句话总结

本文提出了一种新颖的多目标强化学习公平策略学习框架,通过在折现奖励和平均奖励上优化广义基尼公平函数来实现。该研究从理论上证明了使用折现奖励算法近似平均奖励公平策略的合理性,将PPO和A2C算法改进以支持公平性,并在多智能体和连续控制环境中实证验证了GGF正则化智能体在公平性指标上显著优于标准强化学习(更低的变异系数CV,更高的最低带宽)。

ABSTRACT

As the operations of autonomous systems generally affect simultaneously several users, it is crucial that their designs account for fairness considerations. In contrast to standard (deep) reinforcement learning (RL), we investigate the problem of learning a policy that treats its users equitably. In this paper, we formulate this novel RL problem, in which an objective function, which encodes a notion of fairness that we formally define, is optimized. For this problem, we provide a theoretical discussion where we examine the case of discounted rewards and that of average rewards. During this analysis, we notably derive a new result in the standard RL setting, which is of independent interest: it states a novel bound on the approximation error with respect to the optimal average reward of that of a policy optimal for the discounted reward. Since learning with discounted rewards is generally easier, this discussion further justifies finding a fair policy for the average reward by learning a fair policy for the discounted reward. Thus, we describe how several classic deep RL algorithms can be adapted to our fair optimization problem, and we validate our approach with extensive experiments in three different domains.

研究动机与目标

  • 为解决影响多个用户的同时自主系统中的公平性关键需求。
  • 形式化一种新的‘强化学习中的公平优化’问题,利用广义基尼社会福利函数平衡效率、公正性和公平性。
  • 通过推导新的近似误差界,弥合折现奖励与平均奖励设置之间的差距。
  • 将深度强化学习算法(PPO、A2C)适配至大规模和连续状态马尔可夫决策过程中的公平策略学习。
  • 在三个领域中实证验证,GGF正则化智能体在公平性度量上优于标准强化学习和加权和基线。

提出的方法

  • 通过广义基尼社会福利函数形式化公平性,该函数编码了公平性、效率和公正性。
  • 证明了平稳马尔可夫策略足以实现公平最优,并分析了MDP中状态相关的公平性。
  • 推导出使用折现奖励最优策略近似平均奖励最优策略时的近似误差新理论界。
  • 通过在策略目标中引入广义基尼函数作为正则化项,对深度强化学习算法(PPO、A2C)进行改进。
  • 采用两阶段训练流程:先在折现回报上预训练,再通过GGF目标微调以提升公平性。
  • 在三个领域中验证该方法:多智能体资源分配、多智能体导航以及连续控制(DC领域),使用GGF得分和带宽公平性度量。

实验结果

研究问题

  • RQ1在公平性方面,折现奖励最优策略在多大程度上可以近似平均奖励最优策略,且该近似的紧密程度如何界定?
  • RQ2如何将深度强化学习算法适配至在离散和连续MDP中通过广义基尼函数衡量公平性的优化?
  • RQ3将广义基尼函数作为正则化项是否能带来比标准加权和或最大最小基线更优的公平性(如更低的CV、更高的最低效用)?
  • RQ4GGF正则化策略在高折扣因子(如γ = 0.99999)下是否表现稳健,表明其收敛于平均奖励公平性?
  • RQ5该框架是否能有效在连续状态和连续动作环境中学习公平策略?

主要发现

  • 所提出的GGF正则化PPO和A2C智能体在带宽分配中表现出显著更低的变异系数(CV),表明其公平性优于标准强化学习。
  • 在DC连续控制领域,GGF-PPO在GGF得分上优于标准PPO和固定策略,CV降低30%,且最低带宽更高。
  • γ = 0.99与γ = 0.99999的实验结果几乎相同,表明γ = 0.99在实践中已足够近似平均奖励公平性。
  • 折现奖励与平均奖励最优策略之间近似误差的理论界具有独立兴趣,并为使用折现强化学习学习公平策略提供了理论依据。
  • 广义基尼函数正则化训练在不牺牲整体性能的前提下,持续提升公平性,在所有三个领域中均优于等权重和基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。