Skip to main content
QUICK REVIEW

[论文解读] Optimizing the Long-Term Average Reward for Continuing MDPs: A Technical Report

Chao Xu, Yiping Xie|arXiv (Cornell University)|Apr 13, 2021
Age of Information Optimization参考文献 15被引用 5
一句话总结

本文提出了一种新颖的深度强化学习(DRL)框架,将R-learning与函数逼近相结合,以在持续马尔可夫决策过程(MDPs)中优化长期平均奖励,克服了传统DRL算法在设计上仅针对折扣累积奖励所存在的局限性。该方法在无需特殊状态或条件依赖更新的情况下,实现了稳定且高性能的学习,实验结果验证了其在收敛性与方差控制方面的优越表现。

ABSTRACT

Recently, we have struck the balance between the information freshness, in terms of age of information (AoI), experienced by users and energy consumed by sensors, by appropriately activating sensors to update their current status in caching enabled Internet of Things (IoT) networks [1]. To solve this problem, we cast the corresponding status update procedure as a continuing Markov Decision Process (MDP) (i.e., without termination states), where the number of state-action pairs increases exponentially with respect to the number of considered sensors and users. Moreover, to circumvent the curse of dimensionality, we have established a methodology for designing deep reinforcement learning (DRL) algorithms to maximize (resp. minimize) the average reward (resp. cost), by integrating R-learning, a tabular reinforcement learning (RL) algorithm tailored for maximizing the long-term average reward, and traditional DRL algorithms, initially developed to optimize the discounted long-term cumulative reward rather than the average one. In this technical report, we would present detailed discussions on the technical contributions of this methodology.

研究动机与目标

  • 解决在持续MDPs中优化长期平均奖励的挑战,因为传统DRL算法是为折扣累积奖励设计的,由于基本理论差异而失效。
  • 通过支持可扩展且兼容函数逼近的学习方法,克服大规模物联网网络中因传感器和用户数量众多而带来的维度灾难问题。
  • 开发一种DRL框架,在最大化平均奖励的同时保持稳定性和收敛性,避免依赖终止状态或特殊状态选择。
  • 通过修改原始R-learning以支持基于目标网络的高效批量平均奖励更新,确保与深度神经网络的兼容性。
  • 为连续且非终止环境中的平均奖励任务,提供一种理论坚实且实证稳定的现有DRL算法替代方案。

提出的方法

  • 将专为平均奖励最大化设计的表格型强化学习算法R-learning,与深度Q网络结合,扩展其在高维状态-动作空间中的适用性。
  • 重新设计价值函数与贝尔曼最优方程,去除折扣因子,确保平均奖励学习中更新的有限性与意义性。
  • 使用更新频率较低的目标网络来稳定平均奖励更新过程,防止因跟踪不断变化的目标而引发的不稳定性。
  • 将原始R-learning中仅在贪婪动作被采取时才触发的条件性平均奖励更新,替换为基于批次的更新,提升数据效率与学习稳定性。
  • 重新表述DRL训练中的目标值计算方式,使其与平均奖励目标对齐,将更新后的R-learning动态融入损失函数。
  • 采用双学习率机制:一个用于动作价值函数(R(s,a)),另一个用于平均奖励估计(Ũ(k)),以确保独立的收敛动态。

实验结果

研究问题

  • RQ1为何在持续MDPs中,最大化折扣长期累积奖励与最大化长期平均奖励在本质上存在不同?
  • RQ2为何R-learning在理论上和实践上都比RVI Q-learning更适合与深度强化学习在平均奖励设置下集成?
  • RQ3如何对原始R-learning进行修改,以使其在高维空间中与深度神经网络函数逼近兼容?
  • RQ4为确保DRL-based平均奖励学习中的稳定性和数据效率,平均奖励更新规则需要进行哪些修改?
  • RQ5所提出的基于R-learning的DRL框架是否能在无需特殊状态或条件检查的情况下,实现在大规模持续MDPs中的稳定、收敛且低方差的学习?

主要发现

  • 所提出的DDR-DSU算法在最后10次评估中实现了平均奖励均值为-36.59,标准偏差仅为0.19,表明其具有高度的稳定性和收敛性。
  • 与仅在选择贪婪动作时才更新平均奖励的R-learning不同,所提方法采用基于批次的更新,提升了数据效率并消除了经验浪费。
  • 通过使用目标网络计算平均奖励更新,避免了因跟踪快速变化的目标值而引起的不稳定性,显著提升了训练稳定性。
  • 该方法成功避免了对特殊状态进行选择以估计平均奖励的需求,与RVI Q-learning相比更具实用性,适用于DRL应用。
  • 理论分析证实,针对折扣累积奖励优化的标准DRL算法,除非折扣因子γ趋近于1,否则与平均奖励最大化不等价。
  • 将R-learning与DRL结合,可在大规模持续MDPs中实现稳定且可扩展的学习,如在考虑能量与信息时效性权衡的缓存增强型物联网网络中所展示的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。