Skip to main content
QUICK REVIEW

[論文レビュー] Threshold Constraints with Guarantees for Parity Objectives in Markov Decision Processes

Raphaël Berthon, Mickaël Randour|arXiv (Cornell University)|Feb 17, 2017
Formal Methods in Verification参考文献 3被引用数 6
ひとこと要約

本稿は、最悪ケース合成を越えて、マルコフ決定過程におけるパリティ目的へと拡張し、すべてのプレイにおいて主なパリティ条件を満たすことを保証する戦略と、高い確率で満たされる二次的なパリティ条件を導入する。主な貢献は、この問題のすべてのバリアントが NP ∩ coNP に属することを証明し、古典的パリティゲームと同等の複雑さを示し、最適戦略には一般に無限記憶が必要であることを示したことである。

ABSTRACT

The beyond worst-case synthesis problem was introduced recently by Bruyère et al. [BFRR14]: it aims at building system controllers that provide strict worst-case performance guarantees against an antagonistic environment while ensuring higher expected performance against a stochastic model of the environment. Our work extends the framework of [BFRR14] and follow-up papers, which focused on quantitative objectives, by addressing the case of $ω$-regular conditions encoded as parity objectives, a natural way to represent functional requirements of systems. We build strategies that satisfy a main parity objective on all plays, while ensuring a secondary one with sufficient probability. This setting raises new challenges in comparison to quantitative objectives, as one cannot easily mix different strategies without endangering the functional properties of the system. We establish that, for all variants of this problem, deciding the existence of a strategy lies in ${\sf NP} \cap {\sf coNP}$, the same complexity class as classical parity games. Hence, our framework provides additional modeling power while staying in the same complexity class. [BFRR14] Véronique Bruyère, Emmanuel Filiot, Mickael Randour, and Jean-François Raskin. Meet your expectations with guarantees: Beyond worst-case synthesis in quantitative games. In Ernst W. Mayr and Natacha Portier, editors, 31st International Symposium on Theoretical Aspects of Computer Science, STACS 2014, March 5-8, 2014, Lyon, France, volume 25 of LIPIcs, pages 199-213. Schloss Dagstuhl - Leibniz - Zentrum fuer Informatik, 2014.

研究の動機と目的

  • 確率的環境モデル下での高い期待性能を達成しつつ、パリティ目的によって厳密な最悪ケース関数的動作を保証するシステムコントローラーの合成に取り組む。
  • 従来、定量的目的に限られていた最悪ケース合成を越え、パリティ条件として符号化されたω-正則な関数的要件へと拡張する。
  • すべてのプレイにおいて主なパリティ目的を確実に満たし、かつ高い確率(ほとんど確実または閾値以上)で二次的なパリティ目的を満たす戦略の存在と構築を分析する。
  • この拡張されたフレームワークの計算複雑さを特定し、戦略設計における記憶の役割を評価する。

提案手法

  • 本手法は、問題を古典的パリティゲームの解法に還元し、MDPにおけるエンドコンポonent(EC)を特に強連結で一様に良いエンドコンポonent(VGECとUGEC)として分析することに依存する。
  • 戦略合成アルゴリズムは、まず最悪ケースパリティ目的を破る状態を除去し、その後VGECとUGECの和集合を計算して確率的到達可能性を評価する。
  • 初期状態が、主なパリティ目的の確実な満たし方と、VGECまたはUGECへの確率的到達可能性(閾値を超える確率)を満たすかをチェックする。
  • パリティゲームに関する既知の結果を活用し、パcentileクエリとアトラクタ計算を含む確率的モデル検査技術を拡張して応用する。
  • 定理3.5と補題4.3を用いて、パリティゲームの解法と確率的到達可能性チェックを組み合わせることで、NP ∩ coNP 内で動作する。
  • ラウンドベースの構成を用いて無限記憶戦略を構築し、ターゲットコンポーネントへの到達確率を高く保ちつつ、最悪ケースの保証を維持する。

実験結果

リサーチクエスチョン

  • RQ1すべてのプレイにおいて主なパリティ目的を満たす戦略を合成可能であり、かつ二次的なパリティ目的が与えられた閾値より高い確率で満たされるか?
  • RQ2MDPにおける二つのパリティ目的を持つ状況で、このような戦略の存在を決定する計算複雑度は何か?
  • RQ3有限記憶戦略は、最悪ケースと確率的保証の両方を達成するために十分か、それとも無限記憶が必要か?
  • RQ4VGECとUGECの構造をどのように活用して、このような戦略の存在を特徴づけられるか?

主な発見

  • 主なパリティ目的をすべてのプレイで確実に満たし、二次的なパリティ目的を閾値より高い確率で満たす戦略の存在を決定する問題は、NP ∩ coNP に属し、古典的パリティゲームと同等の複雑さを持つ。
  • 二次的目的のほとんど確実な満たし方に対しても同様の複雑さが成り立つため、複雑性理論的観点から拡張が tractable(扱いやすい)ことを示している。
  • 最適な保証を達成するためには、一般に無限記憶が必要であり、有限記憶戦略では特定の構成で二次的目的の満たし確率が正にできないことが示されている。
  • 「確実(S)」と「ほとんど確実(AS)」の演算子のみを用いる場合、目的の論理積をより大きなMDP上の単一のパリティ条件に還元することで、複数のパリティ目的への一般化が可能である。
  • 閾値演算子 P∼c への一般化はより複雑であり、パーセンタイルクエリ技術と統合する必要があるため、今後の研究の方向性を示唆している。
  • 本稿は、厳密および非厳密な閾値に対して明示的なワーニング戦略を提供し、関数的正しさを保ちながら最適な確率的保証を達成するには無限記憶構成が必要であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。