[论文解读] Discounted Continuous-time Markov Decision Processes with Unbounded Rates: the Dynamic Programming Approach
该论文证明了在Borel状态空间和动作空间中,具有无界转移率和成本率的连续时间马尔可夫决策过程存在确定性平稳最优策略。通过Kitaev构造和动态规划方法,证明了受控过程的正则性,最优值函数满足贝尔曼方程,并在紧致性-连续性条件下,即使在无界率和一般成本函数下,最优策略依然存在。
This paper deals with unconstrained discounted continuous-time Markov decision processes in Borel state and action spaces. Under some conditions imposed on the primitives, allowing unbounded transition rates and unbounded (from both above and below) cost rates, we show the regularity of the controlled process, which ensures the underlying models to be well defined. Then we develop the dynamic programming approach by showing that the Bellman equation is satisfied (by the optimal value). Finally, under some compactness-continuity conditions, we obtain the existence of a deterministic stationary optimal policy out of the class of randomized history-dependent policies.
研究动机与目标
- 在具有无界转移率和成本率的随机历史相关策略下,建立受控过程的正则性。
- 为具有无界率的折扣连续时间MDP开发动态规划方法。
- 在一般条件下证明最优值函数满足贝尔曼方程。
- 即使在无界成本率和转移率下,也建立确定性平稳最优策略的存在性。
- 将先前结果扩展至允许Borel状态空间和动作空间以及上下文均无界的成本率。
提出的方法
- 使用Kitaev构造形式化具有随机历史相关策略的连续时间MDP。
- 对基本要素(转移率、成本率、动作集)施加条件,以确保受控过程的正则性。
- 应用Dynkin公式和柯尔莫哥洛夫前向方程分析受控过程,即使该过程并非马尔可夫过程。
- 通过证明最优值函数满足贝尔曼方程,发展动态规划方法。
- 在变换后的值函数上使用压缩映射论证,证明贝尔曼方程解的存在性。
- 使用验证论证表明贝尔曼方程的解对应于一个最优策略。
实验结果
研究问题
- RQ1能否在具有无界转移率和无界成本率的连续时间MDP中严格应用动态规划方法?
- RQ2在基本要素的一般条件下,最优值函数是否满足贝尔曼方程?
- RQ3在具有无界率和Borel状态/动作空间的连续时间MDP中,是否存在确定性平稳最优策略?
- RQ4是否可以将通过Kitaev框架构建连续时间MDP的标准方法扩展至允许具有无界率的随机历史相关策略?
- RQ5在该一般设定下,基本要素的哪些条件可确保贝尔曼方程解的存在性?
主要发现
- 在任意随机历史相关策略下,受控过程均为正则的,确保模型定义良好。
- 最优值函数满足贝尔曼方程,验证了动态规划方法的有效性。
- 在基本要素的紧致性和连续性条件下,存在确定性平稳最优策略。
- 贝尔曼方程的解有界,并属于加权空间 $\mathbf{B}_{w'}(S)$,确保可积性。
- 通过在变换后的值函数上使用压缩映射论证,证明了解的存在性,并给出了不动点的显式界。
- 最优策略由哈密顿-雅可比-贝尔曼方程的极小化器导出,且在示例中给出了动作选择的显式形式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。