Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning for Joint Optimization of Multiple Rewards

Mridul Agarwal, Vaneet Aggarwal|arXiv (Cornell University)|Sep 6, 2019
Age of Information Optimization参考文献 57被引用 4
一句话总结

本文提出基于模型和无模型的强化学习算法,通过长期平均奖励的非线性函数(如公平性度量)联合优化多个奖励。其遗憾界为 $ ilde{O}ig(LKDSig)igg( rac{A}{T}igg)^{1/2}$,在公平性感知调度任务中优于DQN和启发式策略。

ABSTRACT

Finding optimal policies which maximize long term rewards of Markov Decision Processes requires the use of dynamic programming and backward induction to solve the Bellman optimality equation. However, many real-world problems require optimization of an objective that is non-linear in cumulative rewards for which dynamic programming cannot be applied directly. For example, in a resource allocation problem, one of the objectives is to maximize long-term fairness among the users. We notice that when an agent aim to optimize some function of the sum of rewards is considered, the problem loses its Markov nature. This paper addresses and formalizes the problem of optimizing a non-linear function of the long term average of rewards. We propose model-based and model-free algorithms to learn the policy, where the model-based policy is shown to achieve a regret of $\Tilde{O}\left(LKDS\sqrt{\frac{A}{T}} ight)$ for $K$ objectives combined with a concave $L$-Lipschitz function. Further, using the fairness in cellular base-station scheduling, and queueing system scheduling as examples, the proposed algorithm is shown to significantly outperform the conventional RL approaches.

研究动机与目标

  • 解决在马尔可夫决策过程(MDP)中优化累积奖励非线性函数的挑战,标准动态规划因失去马尔可夫性质而失效。
  • 形式化无限时域多目标序列决策中新型的每步平均奖励公式。
  • 开发基于模型和无模型的强化学习算法,以学习用于优化拟凹、Lipschitz连续联合目标函数的随机策略。
  • 在未知转移概率的情况下实现可证明的遗憾界,特别是针对比例公平和α-公平等公平性目标。
  • 在实际应用(如蜂窝基站调度和多队列系统)中,展示优于标准强化学习方法(如DQN)和启发式策略的优越性能。

提出的方法

  • 提出一种基于后验抽样的模型算法,使用狄利克雷分布估计状态转移概率,并在不确定性下学习策略。
  • 通过贝尔曼误差分析,推导出针对随机策略的遗憾界 $ ilde{O}ig(LKDSig)igg( rac{A}{T}igg)^{1/2}$。
  • 引入一种无模型的策略梯度方法,使用神经网络优化随机策略,无需依赖转移模型知识。
  • 采用自适应学习率和小批量训练的随机梯度上升法,更新连续动作空间中的策略参数。
  • 基于贝尔曼误差分析,量化与最优策略的偏差,并将其与时间范围T内的遗憾关联。
  • 通过将目标建模为平均奖励的拟凹、L-Lipschitz函数(包括α-公平性和加权比例公平性),将框架应用于公平性优化。

实验结果

研究问题

  • RQ1强化学习能否有效应用于优化MDP中累积奖励的非线性函数,而标准动态规划因失效?
  • RQ2在多智能体系统中优化公平性等联合目标时,基于模型和无模型的强化学习算法可实现何种遗憾界?
  • RQ3所提出的算法在公平性关键的调度任务中与标准DQN和启发式策略相比表现如何?
  • RQ4当最优策略本质上是非确定性时,能否有效使用策略梯度方法学习和优化随机策略?
  • RQ5在何种条件下,联合优化问题可简化为凸优化或线性规划问题?

主要发现

  • 基于模型的算法实现了 $ ilde{O}ig(LKDSig)igg( rac{A}{T}igg)^{1/2}$ 的遗憾界,该界在时间范围T上为次线性,且随目标数K和状态数S的增加而有利扩展。
  • 无模型的策略梯度算法在队列系统中最大化α-公平性和加权比例公平性方面,显著优于DQN和LQF启发式策略。
  • 在α-公平性情况下,尽管LQF在低负载条件下初始更公平,但所提算法在稳态性能上仍优于DQN和LQF。
  • 在低到达率的加权比例公平性场景中,所提策略梯度方法在50次运行中始终获得比DQN更高的公平性度量,中位数和四分位距显示其具有更优的稳定性和性能。
  • 该框架可有效优化最大最小和拟凹联合目标,且在某些公平性度量下,问题可简化为线性规划。
  • 结果表明,标准Q-learning和DQN无法捕捉非线性奖励函数,而所提方法因直接优化联合目标函数而成功。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。