[论文解读] Energy and Mean-Payoff Parity Markov Decision Processes
本文研究结合了parity、energy和mean-payoff目标的马尔可夫决策过程(MDPs),以建模具有定量资源约束和ω-regular规范的反应式系统。研究结果表明,对于mean-payoff parity MDPs,几乎必然获胜状态的判定问题可在多项式时间内求解;而对于energy parity MDPs,该问题位于NP ∩ coNP,并提出了一个伪多项式时间算法,从而填补了复杂性差距,并改进了先前的PSPACE上界。
We consider Markov Decision Processes (MDPs) with mean-payoff parity and energy parity objectives. In system design, the parity objective is used to encode ω-regular specifications, and the mean-payoff and energy objectives can be used to model quantitative resource constraints. The energy condition requires that the resource level never drops below 0, and the mean-payoff condition requires that the limit-average value of the resource consumption is within a threshold. While these two (energy and mean-payoff) classical conditions are equivalent for two-player games, we show that they differ for MDPs. We show that the problem of deciding whether a state is almost-sure winning (i.e., winning with probability 1) in energy parity MDPs is in NP \cap coNP, while for mean-payoff parity MDPs, the problem is solvable in polynomial time, improving a recent PSPACE bound.
研究动机与目标
- 分析在结合parity与定量目标(energy或mean-payoff)的MDPs中,判定几乎必然获胜策略的计算复杂性。
- 解决energy parity MDPs的复杂性差距,证明该问题位于NP ∩ coNP,并可在伪多项式时间内求解。
- 通过为mean-payoff parity MDPs提供多项式时间算法,改进先前工作中的PSPACE上界。
- 刻画几乎必然获胜策略在energy和mean-payoff parity目标下的内存需求。
- 通过与parity games及两人energy games的关联,建立紧致的复杂性界限。
提出的方法
- 使用末端组件分析,将MDP分解为支持几乎必然获胜策略的强连通子MDP。
- 通过优先考虑偶数优先级,从最小的偶数优先级开始,迭代计算获胜末端组件。
- 对于mean-payoff parity MDPs,通过检查每个末端组件中的最大期望mean-payoff值是否至少为ν,来计算获胜末端组件。
- 采用线性规划计算子MDP中的mean-payoff值,从而实现多项式时间计算。
- 将energy parity MDPs约化为两人energy Büchi游戏,利用已知的NP ∩ coNP算法。
- 应用吸引子和子MDP分析,计算几乎必然到达获胜末端组件的可达性。
实验结果
研究问题
- RQ1energy parity MDPs中判定几乎必然获胜状态的计算复杂性是什么?
- RQ2对于mean-payoff parity MDPs,能否在多项式时间内判定几乎必然获胜,从而改进先前的PSPACE上界?
- RQ3energy和mean-payoff parity MDPs中几乎必然获胜策略的内存需求是什么?
- RQ4尽管在两人游戏中energy和mean-payoff目标是等价的,它们在MDPs中存在何种差异?
- RQ5能否高效计算获胜末端组件,以实现mean-payoff parity目标的多项式时间求解?
主要发现
- 对于mean-payoff parity MDPs,判定几乎必然获胜状态的问题可在多项式时间内求解,提供了紧致的PTIME-完全上界。
- 对于energy parity MDPs,该问题位于NP ∩ coNP,且提出了一个伪多项式时间算法,其上界与目前最佳结果一致,除非parity games属于P。
- 对于non-strict不等式(≥ν)的mean-payoff parity目标,几乎必然获胜策略通常需要无限内存;而对于strict不等式(>ν),有限内存策略已足够。
- 获胜末端组件被定义为具有偶数最小优先级,且其子MDP中最大期望mean-payoff值至少为ν的组件。
- 通过将mean-payoff parity MDPs的值函数约化为对获胜末端组件并集的几乎必然可达性,可实现多项式时间计算。
- energy与parity目标的析取可判定于NP ∩ coNP,而mean-payoff与parity目标的析取可在多项式时间内求解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。