[论文解读] The Odds of Staying on Budget
本文研究了在给定概率阈值下,判断马尔可夫链或马尔可夫决策过程(MDP)是否在由成本不等式布尔组合定义的预算内运行的计算复杂性。对于无环马尔可夫链,其结果为PP-完全;对于无环MDP,其结果为P空间-完全;对于一般MDP,其结果为EXP-完全,提供了比先前指数上界更紧致的复杂性界。
Given Markov chains and Markov decision processes (MDPs) whose transitions are labelled with non-negative integer costs, we study the computational complexity of deciding whether the probability of paths whose accumulated cost satisfies a Boolean combination of inequalities exceeds a given threshold. For acyclic Markov chains, we show that this problem is PP-complete, whereas it is hard for the PosSLP problem and in PSPACE for general Markov chains. Moreover, for acyclic and general MDPs, we prove PSPACE- and EXP-completeness, respectively. Our results have direct implications on the complexity of computing reward quantiles in succinctly represented stochastic systems.
研究动机与目标
- 确定马尔可夫链或MDP在给定概率阈值下满足预算约束的计算复杂性。
- 弥合先前已知的EXP上界与随机系统中预算约束问题实际复杂性之间的差距。
- 为无环和一般模型提供紧致的复杂性分类,区分马尔可夫链与MDP。
- 通过从QSubsetSum游戏和PosSLP问题的约化,建立强于NP的下界。
- 通过明确底层复杂性,使在紧凑表示的随机系统中高效计算奖励分位数成为可能。
提出的方法
- 从QSubsetSum游戏约化,构造一个马尔可夫链,使得存在获胜策略当且仅当超出预算的概率较低。
- 使用概率调度和带累积成本的状态扩展,以在MDP中建模路径成本约束。
- 应用容斥原理和并集界,估计构造的MDP中失败(即超出预算)的概率。
- 利用PosSLP问题建立一般马尔可夫链的难解性结果。
- 设计从QSubsetSum到预算决策问题的对数空间约化,证明在适当复杂性类下的完备性结果。
- 使用成本的二进制编码和仔细的参数设置(例如,M = 2^{n/2} n² ℓ²),以控制概率界并确保约化的正确性。
实验结果
研究问题
- RQ1在整数成本的马尔可夫链中,路径满足布尔组合成本不等式且概率至少为τ的复杂性是什么?
- RQ2当底层模型为MDP而非马尔可夫链时,复杂性如何变化?
- RQ3一般MDP的EXP上界能否被收紧?如果可以,其条件是什么?
- RQ4该问题对无环马尔可夫链是否为PP-完全?与一般链相比有何不同?
- RQ5在概率成本约束背景下,预算决策问题与PosSLP问题之间有何关系?
主要发现
- 无环马尔可夫链的预算决策问题为PP-完全,表明其难度与计算布尔公式的满足赋值数量相当。
- 对于一般马尔可夫链,该问题难于PosSLP问题,且位于P空间内,优于先前已知的EXP上界。
- 无环MDP的该问题为P空间-完全,表明非确定性使复杂性超过马尔可夫链情形。
- 对于一般MDP,该问题为EXP-完全,确立了紧致的复杂性界,并解决了该问题是否低于EXP的开放问题。
- 从QSubsetSum到预算问题的约化表明,该问题难于PosSLP问题,提供了强于NP的下界。
- 结果表明,在紧凑表示的随机系统中计算奖励分位数仅在特定结构约束(如无环性)下才具有计算可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。