Skip to main content
QUICK REVIEW

[論文レビュー] Symbolic Algorithms for Qualitative Analysis of Markov Decision Processes with Büchi Objectives

Krishnendu Chatterjee, Monika Henzinger|arXiv (Cornell University)|Apr 17, 2011
Formal Methods in Verification参考文献 14被引用数 8
ひとこと要約

本稿では、 Büchi 目的関数を備えたマルコフ決定過程(MDP)におけるほぼ確実に勝つ状態集合の計算のための記号的アルゴリズムを提示する。これにより、$O(n\cdot\sqrt{m})$ ステップで実行される、$O(n^2)$ の既存の境界を改善した、部分的二次未塔の記号的アルゴリズムを導入した。また、強連結成分(SCC)内の最大エッジ数を $K$ とすると、$O(n\cdot\sqrt{K})$ ステップで逐次的に勝ち状態集合を計算する、画期的な「勝ち負け」アルゴリズムを提案した。さらに、記号的 SCC 分解の最悪ケースを $5n$ から $4n$ の記号的ステップに改善した。

ABSTRACT

We consider Markov decision processes (MDPs) with ω-regular specifications given as parity objectives. We consider the problem of computing the set of almost-sure winning states from where the objective can be ensured with probability 1. The algorithms for the computation of the almost-sure winning set for parity objectives iteratively use the solutions for the almost-sure winning set for Büchi objectives (a special case of parity objectives). Our contributions are as follows: First, we present the first subquadratic symbolic algorithm to compute the almost-sure winning set for MDPs with Büchi objectives; our algorithm takes O(n \sqrt{m}) symbolic steps as compared to the previous known algorithm that takes O(n^2) symbolic steps, where $n$ is the number of states and $m$ is the number of edges of the MDP. In practice MDPs have constant out-degree, and then our symbolic algorithm takes O(n \sqrt{n}) symbolic steps, as compared to the previous known $O(n^2)$ symbolic steps algorithm. Second, we present a new algorithm, namely win-lose algorithm, with the following two properties: (a) the algorithm iteratively computes subsets of the almost-sure winning set and its complement, as compared to all previous algorithms that discover the almost-sure winning set upon termination; and (b) requires O(n \sqrt{K}) symbolic steps, where K is the maximal number of edges of strongly connected components (scc's) of the MDP. The win-lose algorithm requires symbolic computation of scc's. Third, we improve the algorithm for symbolic scc computation; the previous known algorithm takes linear symbolic steps, and our new algorithm improves the constants associated with the linear number of steps. In the worst case the previous known algorithm takes 5n symbolic steps, whereas our new algorithm takes 4n symbolic steps.

研究の動機と目的

  • MDP における Büchi 目的関数のための効率的な記号的アルゴリズムを開発し、確率的検証分野のコアな問題を解決すること。
  • ほぼ確実に勝つ状態集合を計算する記号的複雑度を低減し、理論的分析および実用的検証パイプラインの両者にとって不可欠な要素を強化すること。
  • 従来の方法が終了時にのみ全集合を返すのに対し、逐次的に勝ち状態を発見する、画期的な「勝ち負け」アルゴリズムのパラダイムを導入すること。
  • MDP 分析の基本的構成要素である記号的 SCC 分解の性能を向上させ、最悪ケースの記号的ステップ数を $5n$ から $4n$ に削減すること。
  • 合成 MDP を用いた実験的検証を通じて、新しいアルゴリズムが古典的手法および既存の記号的手法と比較して顕著な性能向上を示すことを確認すること。

提案手法

  • Büchi 目的関数を備えた MDP におけるほぼ確実に勝つ状態集合の計算のための記号的部分的二次未塔アルゴリズムを提案し、$O(n\\cdot\sqrt{m})$ の記号的ステップで実行可能であることを達成した。
  • 「勝ち負け」アルゴリズムを導入し、ほぼ確実に勝つ状態集合の部分集合とその補集合を反復的に計算することで、実行中に勝ち状態を早期に検出可能にした。
  • 記号的 SCC 分解を基本的プリミティブとして活用し、最悪ケースの記号的ステップ数を $5n$ から $4n$ に削減する新しいアルゴリズムを用いて最適化した。
  • 明示的な状態列挙を避けるために、標準的な記号的データ構造を用いてアルゴリズムを設計および実装した。
  • 自明なグラフを回避し、意味のある性能評価を保証するため、構造的ランダム MDP の生成手法を用いた。
  • さまざまな状態数を有する合成ベンチマーク上で、新しいアルゴリズムを古典的および既存の記号的アルゴリズムと比較した。

実験結果

リサーチクエスチョン

  • RQ1Büchi 目的関数を備えた MDP におけるほぼ確実に勝つ状態集合は、部分的二次未塔の記号的ステップ数で計算可能か?
  • RQ2終了時にのみ勝ち状態を返すのではなく、実行中に逐次的に勝ち状態を特定できる記号的アルゴリズムを設計可能か?
  • RQ3記号的 SCC 分解を最適化し、最悪ケースの記号的ステップ数の定数係数を低減可能か?
  • RQ4実際のベンチマークにおいて、新しいアルゴリズムは古典的および既存の記号的手法と比較して顕著な性能向上を示すか?
  • RQ5「勝ち負け」アルゴリズムによる勝ち状態の逐次的発見は、実世界の検証ワークロードにおいて実用的利点をもたらすか?

主な発見

  • 提案された記号的アルゴリズムは、$O(n\\cdot\sqrt{m})$ の記号的ステップでほぼ確実に勝つ状態集合を計算可能であり、従来の $O(n^2)$ の境界を顕著に改善した。
  • 出次数が定数である MDP に対しては、新しいアルゴリズムは $O(n\\cdot\sqrt{n})$ の記号的ステップで実行可能であり、従来手法の $O(n^2)$ と比較して顕著な改善を示した。
  • 「勝ち負け」アルゴリズムは $O(n\\cdot\sqrt{K})$ の記号的ステップを要し、$K$ は任意の SCC 内の最大エッジ数を表す。実行中に勝ち状態が逐次的に明らかになる。
  • 新しい記号的 SCC 分解アルゴリズムにより、最悪ケースの記号的ステップ数が $5n$ から $4n$ に削減され、定数係数で 20% の改善が達成された。
  • 実験的結果では、新しいアルゴリズムがはるかに少ない記号的ステップ数と短い実行時間を要することが示された。20,000 状態の場合、古典的手法は約 306,000 ステップを要したが、最良の新しいアルゴリズムではわずか約 13,700 ステップにまで削減された。
  • 実行時間の改善も顕著であった。20,000 状態の場合、古典的手法は約 3,974 秒を要したが、最良の新しいアルゴリズムではわずか 217 秒にまで短縮された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。