Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Control of MDPs with Temporal Logic Constraints

Mária Svoreňová, Ivana Černá|arXiv (Cornell University)|Mar 8, 2013
Formal Methods in Verification参考文献 14被引用数 6
ひとこと要約

本稿では、線形時相論理(LTL)仕様を満たしつつ、監視状態への連続する訪問間の期待平均コストを最小化する制御方策の最適合成のためのアルゴリズムを提示する。自動機に基づくモデルチェックインとゲーム理論的技術を組み合わせることで、正しさと最適性を保証する有限記憶戦略を計算可能にし、ロボット監視の事例研究において40.5の最適平均コスト/サイクルを達成した。これは、先行する部分最適な動的計画法の手法を上回る結果である。

ABSTRACT

In this paper, we focus on formal synthesis of control policies for finite Markov decision processes with non-negative real-valued costs. We develop an algorithm to automatically generate a policy that guarantees the satisfaction of a correctness specification expressed as a formula of Linear Temporal Logic, while at the same time minimizing the expected average cost between two consecutive satisfactions of a desired property. The existing solutions to this problem are sub-optimal. By leveraging ideas from automata-based model checking and game theory, we provide an optimal solution. We demonstrate the approach on an illustrative example.

研究の動機と目的

  • 実数コストを伴うLTL制約下でのMDPにおける最適制御合成のギャップを埋めること。
  • 時間論理的仕様の満たされるとともに、望ましい状態への連続する訪問間の期待平均コストを最小化する手法を開発すること。
  • 先行研究における動的計画法に基づく手法の部分最適性を克服すること。
  • 最近のゲーム理論および確率的モデル検査の進展を活用して、完全なLTL仕様に対して整合的かつ完全な解決策を提供すること。

提案手法

  • 元のMDPとLTL式を表すラビン自動機との積MDPを構築する。
  • 積MDP内で、LTL仕様を満たす長期的行動をサポートする最大エンド成分(MAEC)を同定する。
  • 各MAEC内で平均コスト/サイクルを最小化する最適戦略を、ゲーム理論的技術を用いて計算する。
  • 最初にMAECに到達し、その後はその内部で最適戦略に従う有限記憶戦略を用いる。
  • 1\frac{1}{2}プレーヤーゲーム理論の最近の結果を活用して、解の最適性を保証する。
  • 可能であれば監視フェーズを動的に短縮するルールを統合し、最適性を損なわずに効率性を向上させる。
Figure 1 : Illustration of Alg. 1 . A part of an MAEC $\mathcal{N}$ is shown in the left. An auxiliary MDP $X$ is constructed by transforming actions of $\mathcal{N}$ to partial stationary strategies. The MDP $X$ after eliminating the state $v$ is shown on the right. The costs associated with action
Figure 1 : Illustration of Alg. 1 . A part of an MAEC $\mathcal{N}$ is shown in the left. An auxiliary MDP $X$ is constructed by transforming actions of $\mathcal{N}$ to partial stationary strategies. The MDP $X$ after eliminating the state $v$ is shown on the right. The costs associated with action

実験結果

リサーチクエスチョン

  • RQ1MDPに対して、監視状態への連続する訪問間の期待平均コストを最小化しつつ、LTL式の満たされる制御方策を合成可能か?
  • RQ2この制御合成問題において、部分最適な動的計画法のヒューリスティクスに依存するのではなく、最適性を達成可能か?
  • RQ3自動機に基づくモデルチェックインとゲーム理論的技術をどのように組み合わせて、時間論理的制約下での最適制御問題を解決できるか?
  • RQ4有限記憶制御とフェーズベース実行の観点から、最適戦略の構造はどのようなものか?
  • RQ5平均コスト/サイクルという観点から、本手法は既存の部分最適な手法と定量的にどのように比較できるか?

主な発見

  • ロボット監視の事例研究において、提案手法は40.5の最適平均コスト/サイクル(ACPC)を達成した。これは、[11]で報告された部分最適手法の50.5 ACPCを下回る結果である。
  • 1ラウンドあたりの平均ジョブ数は130であり、中央値はわずか14であった。これは、ラウンドの履歴に依存しない安定的かつ効率的な性能を示している。
  • 実行の98%において、最適化ルールにより各ラウンドの第二フェーズが短縮された。これは、不要な監視サイクルを顕著に削減したことを示している。
  • ラウンド >1 において、第一フェーズ(ベース帰還)のステップ数は常に5であった。これはジョブ状態からベースへの固定経路によるものである。
  • 最適戦略は、最初に最大エンド成分(MAEC)に到達し、その後その内部で最適戦略に従う有限記憶方策として合成された。
  • 本手法は完全なLTLに対して整合的かつ完全である。これは、先行する部分最適な手法とは異なり、このクラスの問題に対する最初の最適解を提供している。
Figure 2 : (a) Initialized MDP $\mathcal{M}$ with initial state 0. The costs of applying $\alpha,\beta,\gamma$ in any states are 5, 10, 1, respectively, e.g., $g(1,\alpha)=5$ . (b) Definitions of strategies $C_{init},C_{p1},C_{p2}$ for $\mathcal{M}$ , the projections of strategies $C_{0},C_{\mathcal
Figure 2 : (a) Initialized MDP $\mathcal{M}$ with initial state 0. The costs of applying $\alpha,\beta,\gamma$ in any states are 5, 10, 1, respectively, e.g., $g(1,\alpha)=5$ . (b) Definitions of strategies $C_{init},C_{p1},C_{p2}$ for $\mathcal{M}$ , the projections of strategies $C_{0},C_{\mathcal

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。