[论文解读] Threshold Constraints with Guarantees for Parity Objectives in Markov Decision Processes
该论文将最坏情况合成扩展至马尔可夫决策过程中的平等目标,提出了一类策略,可在所有执行路径上保证满足主要平等条件,同时以高概率满足次要平等条件。核心贡献在于证明了此类问题的所有变体均属于 NP ∩ coNP,与经典平等游戏的复杂度一致,并表明最优策略通常需要无限记忆。
The beyond worst-case synthesis problem was introduced recently by Bruyère et al. [BFRR14]: it aims at building system controllers that provide strict worst-case performance guarantees against an antagonistic environment while ensuring higher expected performance against a stochastic model of the environment. Our work extends the framework of [BFRR14] and follow-up papers, which focused on quantitative objectives, by addressing the case of $ω$-regular conditions encoded as parity objectives, a natural way to represent functional requirements of systems. We build strategies that satisfy a main parity objective on all plays, while ensuring a secondary one with sufficient probability. This setting raises new challenges in comparison to quantitative objectives, as one cannot easily mix different strategies without endangering the functional properties of the system. We establish that, for all variants of this problem, deciding the existence of a strategy lies in ${\sf NP} \cap {\sf coNP}$, the same complexity class as classical parity games. Hence, our framework provides additional modeling power while staying in the same complexity class. [BFRR14] Véronique Bruyère, Emmanuel Filiot, Mickael Randour, and Jean-François Raskin. Meet your expectations with guarantees: Beyond worst-case synthesis in quantitative games. In Ernst W. Mayr and Natacha Portier, editors, 31st International Symposium on Theoretical Aspects of Computer Science, STACS 2014, March 5-8, 2014, Lyon, France, volume 25 of LIPIcs, pages 199-213. Schloss Dagstuhl - Leibniz - Zentrum fuer Informatik, 2014.
研究动机与目标
- 解决系统控制器的合成问题,通过平等目标保证严格最坏情况下的功能行为,同时在随机环境模型下实现高期望性能。
- 将最坏情况合成从此前仅限于定量目标的范围,扩展至以平等条件编码的 ω-正则功能需求。
- 分析并构造满足主要平等目标确定性(surely)且次要平等目标以高概率(几乎必然或高于阈值)满足的策略。
- 确定此扩展框架的计算复杂度,并评估记忆在策略设计中的作用。
提出的方法
- 该方法通过将问题约化为求解经典平等游戏,并分析 MDP 中的终态组件(ECs),特别是强连通且一致优良的终态组件(VGECs 和 UGECs)来实现。
- 设计了一种策略合成算法,首先移除违反最坏情况平等目标的状态,然后计算 VGECs 和 UGECs 的并集以评估概率可达性。
- 该算法检查初始状态是否同时满足主要平等目标的确定性满足,以及对 VGECs 或 UGECs 的概率可达性高于给定阈值。
- 该方法利用了平等游戏的已知结果,并通过概率模型检测技术(包括分位数查询和吸引子计算)进行扩展。
- 通过结合平等游戏求解与基于定理 3.5 和引理 4.3 的概率可达性检查,该算法在 NP ∩ coNP 内运行。
- 通过基于轮次的构造方法构建无限记忆策略,以确保以高概率到达目标组件,同时保持最坏情况下的保证。
实验结果
研究问题
- RQ1能否合成出在所有执行路径上保证满足主要平等目标,且次要平等目标满足概率大于给定阈值的策略?
- RQ2在具有两个平等目标的 MDP 中,判定此类策略存在的计算复杂度为何?
- RQ3有限记忆策略是否足以同时实现最坏情况与概率性保证,还是必须使用无限记忆?
- RQ4如何利用终态组件的结构(VGECs 和 UGECs)来刻画此类策略的存在性?
主要发现
- 判定是否存在一种策略,使得主要平等目标被确定性满足,且次要平等目标以高于阈值的概率满足,该问题属于 NP ∩ coNP,与经典平等游戏的复杂度一致。
- 当次要目标为几乎必然满足时,复杂度保持不变,表明该扩展在复杂性理论意义上保持了可 tractability。
- 通常需要无限记忆策略才能同时实现两种保证,因为有限记忆策略在某些配置下无法实现满足次要目标的正概率。
- 当仅使用确定性(S)和几乎必然(AS)算符时,该问题可推广至多个平等目标,通过将目标合取约化为更大 MDP 上的单一平等条件。
- 对于阈值算符 P∼c,推广更为复杂,需与分位数查询技术结合,提示未来研究方向。
- 本文为严格与非严格阈值提供了显式见证策略,证明了无限记忆构造在实现最优概率保证的同时保持功能正确性方面是必要的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。