Skip to main content
QUICK REVIEW

[論文レビュー] Control Design for Markov Chains under Safety Constraints: A Convex Approach

Eduardo R. Arvelo, Nuno C. Martins|arXiv (Cornell University)|Sep 13, 2012
Advanced Control Systems Optimization参考文献 14被引用数 4
ひとこと要約

本稿では、安全制約のもとで、禁止状態に到達しないことを保証する時間不変かつメモリレスな制御方策を設計するための凸最適化手法を提案する。有限パrameter化されたエントロピー最大化プログラムを定式化することで、安全な再発的状態の最大集合を特定し、標準的な凸最適化ソルバを用いて効率的に計算可能である。

ABSTRACT

This paper focuses on the design of time-invariant memoryless control policies for fully observed controlled Markov chains, with a finite state space. Safety constraints are imposed through a pre-selected set of forbidden states. A state is qualified as safe if it is not a forbidden state and the probability of it transitioning to a forbidden state is zero. The main objective is to obtain control policies whose closed loop generates the maximal set of safe recurrent states, which may include multiple recurrent classes. A design method is proposed that relies on a finitely parametrized convex program inspired on entropy maximization principles. A numerical example is provided and the adoption of additional constraints is discussed.

研究の動機と目的

  • 事前に定義された禁止状態への遷移を完全に回避する制御方策を設計し、制御されたマーカフチェーンにおける再発的状態の数を最大化すること。
  • 時間不変かつメモリレスな制御方策のもとで、再発的かつ安全(=禁止状態に到達できない)である状態の最大集合を同定すること。
  • 凸プログラミングを用いて、このような制御方策を計算的に実行可能に同定する手法を開発すること。
  • エントロピー最大化の原則と標準的な凸最適化ツールを活用することで、解のロバスト性とスケーラビリティを確保すること。
  • 凸性を損なわずに、期待コストやリソース制限などの追加制約をフレームワークに組み込むこと。

提案手法

  • 制御設計問題を、制約下での状態-制御分布の同時エントロピーを最大化する凸計画問題として定式化する。
  • 最適化変数として各状態における制御方策確率を用いる有限パrameter化定式化を採用する。
  • 解集合に属する任意の状態から、禁止状態への遷移確率が正確にゼロになるように制約を課す。
  • 閉ループマーカフチェーンの不変分布を、再発性と安全性の検証に重要な要素として用いる。
  • 最適解と不変分布のサポートを結びつける双対定式化を導出し、最大安全再発的集合の同定を可能にする。
  • 計算複雑性を低減しつつも同じサポートを保つように、状態周辺分布のエントロピーを最大化するように変更した目的関数を導入する。

実験結果

リサーチクエスチョン

  • RQ1時間不変かつメモリレスな制御方策のもとで、制御されたマーカフチェーンにおける再発的状態の最大集合は、禁止状態に到達できないようにできるか?
  • RQ2この最大安全再発的集合は、凸最適化フレームワークを用いて体系的に計算可能か?
  • RQ3エントロピー最大化の原則をどのように活用することで、最大安全再発的状態を達成する制御方策を設計できるか?
  • RQ4期待制御コストなどの追加凸制約を加えると、解の構造と実行可能性にどのような影響を与えるか?
  • RQ5提案手法は、再発性に必要な不変分布構造を保ちながら、安全性を強制するか?

主な発見

  • 安全な再発的状態の最大集合 $\mathbb{X}_{\mathbb{F}}^{R}$ は、明確に定義され、適切な制御方策によって達成可能である。
  • エントロピー最大化に基づく提案された凸計画問題の解のサポートは、正確に $\mathbb{X}_{\mathbb{F}}^{R}$ に一致し、この集合に属するすべての状態が再発的かつ安全であることを保証する。
  • 凸計画問題の最適解から式 (5) を用いて最適制御方策 $\mathcal{K}^{*}_{R}$ を導出可能であり、これにより閉ループチェーンが最大安全再発的集合を持つことが保証される。
  • 同時分布ではなく状態周辺分布のエントロピーを最大化するように変更した凸計画問題は、同じサポート $\mathbb{S}_{f^{*}_{X}}$ を得るため、計算コストを削減しながらも解を保持する。
  • 追加の凸制約、例えば $\sum h(u)f_{XU}(x,u) \leq \beta$ を最適化に組み込むことで凸性を維持でき、$h(U_k)$ の時間平均値が $\beta$ 以下に制限される。
  • 安全再発的集合が1つの非周期的クラスしか含まない場合、任意の初期分布から出発しても、任意の関数 $h(U_k)$ の長期的期待値は $\beta$ で抑えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。