[论文解读] A New Condition for the Existence of Optimal Stationary Policies in Denumerable State Average Cost Continuous Time Markov Decision Processes with Unbounded Cost and Transition Rates
本文提出了一类可数状态连续时间马尔可夫决策过程(CTMDPs)中最优平稳策略存在的新存在性条件,适用于无界成本与转移率的情形。通过将最优策略的存在性与到达参考状态的期望首次 passage 时间及成本的有限性相联系,该方法借助已知的排队系统稳定性结果,避免了复杂函数构造,显著简化了验证过程,并在较弱条件下确保平均成本最优方程成立。
This paper presents a new condition for the existence of optimal stationary policies in average-cost continuous-time Markov decision processes with unbounded cost and transition rates, arising from controlled queueing systems. This condition is closely related to the stability of queueing systems. It suggests that the proof of the stability can be exploited to verify the existence of an optimal stationary policy. This new condition is easier to verify than existing conditions. Moreover, several conditions are provided which suffice for the average-cost optimality equality to hold.
研究动机与目标
- 解决在具有无界成本与转移率的连续时间马尔可夫决策过程中验证最优平稳策略的挑战。
- 提出一种更易验证的平均成本最优平稳策略存在性条件,优于既有的基于函数的方法。
- 将最优策略的存在性与底层排队系统的稳定性相联系,实现对现有稳定性分析的复用。
- 建立平均成本最优方程(ACOE)成立的充分条件。
提出的方法
- 提出一种基于从任意状态到参考状态在给定策略下期望首次 passage 时间与期望成本有限性的新存在性条件。
- 引入“标准策略”概念——具体而言,若从状态 i₀ 出发的期望首次 passage 时间与成本均有限,则称该策略为 i₀-标准策略。
- 采用带指数加权的李雅普诺夫函数方法,通过涉及转移率与成本函数的不等式关系,验证期望成本的有限性。
- 理论上应用统一化方法,但重点聚焦于其失效的无界率情形,从而证明直接分析 CTMDP 的合理性。
- 证明:若策略为 i₀-标准且满足特定漂移条件,则平均成本最优不等式(ACOI)成立。
- 在有限活动条件(每个状态仅有有限次转移)下,证明 ACOE 在全局范围内成立。
实验结果
研究问题
- RQ1是否可以在不构造复杂验证函数的前提下,建立无界 CTMDPs 中最优平稳策略存在的条件?
- RQ2排队理论中的系统稳定性结果在多大程度上可被用于验证 CTMDPs 中的策略最优性?
- RQ3在具有无界率与成本的可数状态 CTMDPs 中,平均成本最优方程(ACOE)在何种条件下成立?
- RQ4是否存在一种条件,可通过检查首次 passage 时间与成本的有限性,简化最优策略的验证过程?
主要发现
- 所提出的最优平稳策略存在性条件基于到达参考状态的期望首次 passage 时间与期望成本的有限性,其验证比以往基于函数的条件更为简便。
- 在双队列系统中,优先服务(PS)策略被证明为 0-标准策略,从而在新条件下确认其最优性。
- 通过带指数加权的李雅普诺夫函数与不等式约束,证明了在 PS 策略下,从任一状态到原点的期望成本为有限值。
- 当策略为 i₀-标准且每个状态仅有有限次转移时,平均成本最优方程(ACOE)对所有状态均成立。
- 该方法可复用排队理论中已有的稳定性结果,以建立策略最优性,而无需构造与问题相关的特定函数。
- 该结果可推广至关于状态向量单调递增且为多项式形式的成本函数,从而扩大了适用范围。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。