Skip to main content
QUICK REVIEW

[論文レビュー] Optimal strategies for impulse control of piecewise deterministic Markov processes

Benoîte de Saporta, François Dufour|arXiv (Cornell University)|Mar 25, 2016
Advanced Control Systems Optimization参考文献 19被引用数 11
ひとこと要約

本稿では、1回のジャンプまたは干渉を行う演算子を用いて、区分的確率的マルコフ過程(PDMPs)のε-最適インパルス制御戦略の明示的で新しい構成を提案する。従来の方法が補助的最適停止問題の解法や全価値関数の計算を必要とするのに対し、本手法は、インパルスをとらない戦略のコストのみを必要とし、数値的近似とεの範囲内で最適コストに収束する構成可能な戦略の生成が可能になる。

ABSTRACT

This paper deals with the general discounted impulse control problem of a piecewise deterministic Markov process. We investigate a new family of epsilon-optimal strategies. The construction of such strategies is explicit and only necessitates the previous knowledge of the cost of the no-impulse strategy. In particular, it does not require the resolution of auxiliary optimal stopping problem or the computation of the value function at each point of the state space. This approach is based on the iteration of a single-jump-or-intervention operator associated to the piecewise deterministic Markov process.

研究の動機と目的

  • 区分的確率的マルコフ過程(PDMPs)の無限時間割引インパルス制御に対する新しいε-最適戦略の族を開発すること。
  • 補助的最適停止問題の解法や各状態点における価値関数の計算を必要とせず、インパルスをとらない戦略のコストのみを用いる戦略を構築すること。
  • 数値的実装と近似を支援する、ε-最適戦略の構成的メソッドを提供すること。
  • U.S. Gugerliのε-最適停止時刻の枠組みを、介入時刻と新たな出発点を同時に扱うより複雑なインパルス制御設定へと拡張すること。

提案手法

  • 本手法は、PDMPに関連する1回のジャンプまたは干渉を行う演算子の反復により、近似価値関数の系列を構築する。
  • 戦略を明示的に符号化する補助的制御過程を導入し、介入時刻と新たな状態を、rε^N₀(x) を含むしきい値に基づくルールで定義する。
  • 戦略は、ε-最適性条件から導かれる停止時刻 t*(x) と、いつ介入するかを決定するしきい値 rε^N₀(x) を用いる。
  • 本構成は、流れ、ジャンプ強度 λ、およびマルコフ核 Q を含むPDMPのパスワイズダイナミクスに依存し、介入ルールを定義する。
  • 連続状態と残りの干渉回数 N₀ を追跡する変換された状態空間に依存する。
  • 変分不等式やハミルトニアン・ジャコビ・ベルマン方程式の解法を回避し、代わりに単一の演算子による反復的近似に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1PDMPsのε-最適インパルス制御戦略は、補助的最適停止問題の解法や全価値関数の計算を必要とせず、明示的に構築可能か?
  • RQ2インパルスをとらない戦略のコストと1回のジャンプまたは干渉を行う演算子のみを用いて、ε-最適戦略を生成することは可能か?
  • RQ3PDMPsにおいて、介入時刻と新たな出発状態を同時に最適化する構成的アプローチはどのように実現できるか?
  • RQ4単一の演算子の反復的適用により、真の価値関数からεの範囲内で収束する近似価値関数を生成できるか?

主な発見

  • 提案された戦略は、1回のジャンプまたは干渉を行う演算子の反復により、近似価値関数の系列を構築することでε-最適性を達成する。
  • 本手法は、補助的最適停止問題の解法や各状態点における価値関数の計算を必要とせず、インパルスをとらない戦略のコストのみを必要とする。
  • 構成は完全に明示的かつ構成的であり、ε-最適戦略の直接的実装と数値的近似を可能にする。
  • 補助的過程は、そのコストが正確に近似価値関数に対応するように設計されており、最適コストからεの範囲内で収束することが保証される。
  • 本手法は、Gugerliのε-最適停止戦略をインパルス制御設定へと一般化し、介入のタイミングと状態選択を同時に処理できる。
  • 本手法は、PDMPインパルス制御におけるε-最適戦略の数値的近似への実用的で構成的な道筋を提供する最初の手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。