[论文解读] A Reinforcement Learning Formulation of the Lyapunov Optimization: Application to Edge Computing Systems with Queue Stability
本文提出了一种基于深度强化学习(DRL)的李雅普诺夫优化方法,用于边缘计算系统,可在队列稳定性约束下实现时间平均惩罚最小化。通过设计一种基于李雅普诺夫漂移条件派生出奖励函数的结构化马尔可夫决策过程(MDP),该方法避免了每时隙的优化计算,并成功处理了非凸与不连续的惩罚函数,在复杂场景下优于传统DPP算法。
In this paper, a deep reinforcement learning (DRL)-based approach to the Lyapunov optimization is considered to minimize the time-average penalty while maintaining queue stability. A proper construction of state and action spaces is provided to form a proper Markov decision process (MDP) for the Lyapunov optimization. A condition for the reward function of reinforcement learning (RL) for queue stability is derived. Based on the analysis and practical RL with reward discounting, a class of reward functions is proposed for the DRL-based approach to the Lyapunov optimization. The proposed DRL-based approach to the Lyapunov optimization does not required complicated optimization at each time step and operates with general non-convex and discontinuous penalty functions. Hence, it provides an alternative to the conventional drift-plus-penalty (DPP) algorithm for the Lyapunov optimization. The proposed DRL-based approach is applied to resource allocation in edge computing systems with queue stability and numerical results demonstrate its successful operation.
研究动机与目标
- 为解决传统漂移加惩罚(DPP)算法带来的计算负担,该算法需在每个时隙求解复杂的优化问题。
- 使强化学习(RL)能够在最小化时间平均惩罚的同时保证队列稳定性,此目标具有挑战性,因为RL的奖励最大化目标与稳定性约束存在冲突。
- 设计合适的MDP形式,构建结构化的状态空间与动作空间,以支持李雅普诺夫优化中稳定且高效的DRL训练。
- 设计一类奖励函数,可在保证队列稳定的同时最小化惩罚,且与实际的折扣RL算法(如SAC)兼容。
- 在具有真实、非凸且不连续惩罚函数的边缘计算资源分配场景中验证该方法,传统DPP算法在此类场景中已失效。
提出的方法
- 构建一个马尔可夫决策过程(MDP),其状态空间包含队列长度和任务到达统计特性,动作空间用于任务卸载与计算资源分配。
- 基于李雅普诺夫漂移加惩罚条件推导出奖励函数,确保最大化期望累积奖励可实现队列稳定性。
- 将奖励函数转化为适用于折扣RL的单步差分形式,使其可与Soft Actor-Critic(SAC)等算法结合使用。
- 采用Soft Actor-Critic(SAC)算法训练DRL策略,联合最小化惩罚并维持队列稳定性。
- 在具有多种应用类型的边缘计算系统上验证该方法,采用真实的任务到达模型和不连续的惩罚函数。
- 使用仿真环境将DRL性能与DPP进行对比,尤其在非凸与不连续代价函数条件下。
实验结果
研究问题
- RQ1基于DRL的方法能否在保持队列稳定性的前提下,替代计算开销较大的DPP算法用于李雅普诺夫优化?
- RQ2如何将队列稳定性约束编码进RL的奖励函数中,以通过策略学习实现长期稳定性?
- RQ3所提出的DRL形式能否处理传统DPP优化失效的非凸与不连续惩罚函数?
- RQ4当动作空间维度增加时,DRL方法在学习效率与性能表现方面如何扩展?
- RQ5DRL策略能否在时间平均惩罚与队列长度之间实现与理论边界相当的有利权衡?
主要发现
- DRL-SAC智能体在所有测试场景中成功学习到一种策略,可在保持队列稳定的同时最小化时间平均惩罚,包括存在不连续惩罚函数的情况。
- 针对基于CPU核心分配的不连续惩罚函数,DPP算法因不可微性而失效,而DRL方法成功应对,展现出对非凸性的强鲁棒性。
- 在高维场景下(N=8种应用),DRL方法保持了稳定的学习过程与有效的队列控制,队列长度随时间保持有界。
- DRL-SAC智能体实现的平均惩罚与平均队列长度之间的权衡符合理论预期,当V=100时,惩罚较低且队列稳定。
- 学习曲线显示在50万步内实现收敛,执行阶段结果表明在多个回合中性能保持一致。
- 所提出的奖励函数设计成功将李雅普诺夫稳定性条件编码进RL目标中,实现了稳定训练,无需显式约束强制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。