Skip to main content
QUICK REVIEW

[论文解读] Energy and Mean-Payoff Parity Markov Decision Processes

Krishnendu Chatterjee, Laurent Doyen|arXiv (Cornell University)|Jan 1, 2011
Formal Methods in Verification参考文献 16被引用 10
一句话总结

本文研究结合了parity、energy和mean-payoff目标的马尔可夫决策过程(MDPs),以建模具有定量资源约束和ω-regular规范的反应式系统。研究结果表明,对于mean-payoff parity MDPs,几乎必然获胜状态的判定问题可在多项式时间内求解;而对于energy parity MDPs,该问题位于NP ∩ coNP,并提出了一个伪多项式时间算法,从而填补了复杂性差距,并改进了先前的PSPACE上界。

ABSTRACT

We consider Markov Decision Processes (MDPs) with mean-payoff parity and energy parity objectives. In system design, the parity objective is used to encode ω-regular specifications, and the mean-payoff and energy objectives can be used to model quantitative resource constraints. The energy condition requires that the resource level never drops below 0, and the mean-payoff condition requires that the limit-average value of the resource consumption is within a threshold. While these two (energy and mean-payoff) classical conditions are equivalent for two-player games, we show that they differ for MDPs. We show that the problem of deciding whether a state is almost-sure winning (i.e., winning with probability 1) in energy parity MDPs is in NP \cap coNP, while for mean-payoff parity MDPs, the problem is solvable in polynomial time, improving a recent PSPACE bound.

研究动机与目标

  • 分析在结合parity与定量目标(energy或mean-payoff)的MDPs中,判定几乎必然获胜策略的计算复杂性。
  • 解决energy parity MDPs的复杂性差距,证明该问题位于NP ∩ coNP,并可在伪多项式时间内求解。
  • 通过为mean-payoff parity MDPs提供多项式时间算法,改进先前工作中的PSPACE上界。
  • 刻画几乎必然获胜策略在energy和mean-payoff parity目标下的内存需求。
  • 通过与parity games及两人energy games的关联,建立紧致的复杂性界限。

提出的方法

  • 使用末端组件分析,将MDP分解为支持几乎必然获胜策略的强连通子MDP。
  • 通过优先考虑偶数优先级,从最小的偶数优先级开始,迭代计算获胜末端组件。
  • 对于mean-payoff parity MDPs,通过检查每个末端组件中的最大期望mean-payoff值是否至少为ν,来计算获胜末端组件。
  • 采用线性规划计算子MDP中的mean-payoff值,从而实现多项式时间计算。
  • 将energy parity MDPs约化为两人energy Büchi游戏,利用已知的NP ∩ coNP算法。
  • 应用吸引子和子MDP分析,计算几乎必然到达获胜末端组件的可达性。

实验结果

研究问题

  • RQ1energy parity MDPs中判定几乎必然获胜状态的计算复杂性是什么?
  • RQ2对于mean-payoff parity MDPs,能否在多项式时间内判定几乎必然获胜,从而改进先前的PSPACE上界?
  • RQ3energy和mean-payoff parity MDPs中几乎必然获胜策略的内存需求是什么?
  • RQ4尽管在两人游戏中energy和mean-payoff目标是等价的,它们在MDPs中存在何种差异?
  • RQ5能否高效计算获胜末端组件,以实现mean-payoff parity目标的多项式时间求解?

主要发现

  • 对于mean-payoff parity MDPs,判定几乎必然获胜状态的问题可在多项式时间内求解,提供了紧致的PTIME-完全上界。
  • 对于energy parity MDPs,该问题位于NP ∩ coNP,且提出了一个伪多项式时间算法,其上界与目前最佳结果一致,除非parity games属于P。
  • 对于non-strict不等式(≥ν)的mean-payoff parity目标,几乎必然获胜策略通常需要无限内存;而对于strict不等式(>ν),有限内存策略已足够。
  • 获胜末端组件被定义为具有偶数最小优先级,且其子MDP中最大期望mean-payoff值至少为ν的组件。
  • 通过将mean-payoff parity MDPs的值函数约化为对获胜末端组件并集的几乎必然可达性,可实现多项式时间计算。
  • energy与parity目标的析取可判定于NP ∩ coNP,而mean-payoff与parity目标的析取可在多项式时间内求解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。