Skip to main content
QUICK REVIEW

[論文レビュー] Optimality Conditions in Variational Form for Non-Linear Constrained Stochastic Control Problems

Laurent Pfeiffer|arXiv (Cornell University)|Feb 12, 2018
Optimization and Variational Analysis参考文献 30被引用数 11
ひとこと要約

本稿は、コストおよび制約が状態の最終確率分布に依存する非線形制約付き確率的制御問題に対する変分的最適性条件を確立する。到達可能分布の凸性の性質を用いて、変分不等式条件を導出し、各反復で動的計画法を用いて標準的な確率的制御問題を解く増大ラグランジュ法を提案する。2つの学術的例題を用いた検証により有効性が確認された。

ABSTRACT

Optimality conditions in the form of a variational inequality are proved for a class of constrained optimal control problems of stochastic differential equations. The cost function and the inequality constraints are functions of the probability distribution of the state variable at the final time. The analysis uses in an essential manner a convexity property of the set of reachable probability distributions. An augmented Lagrangian method based on the obtained optimality conditions is proposed and analyzed for solving iteratively the problem. At each iteration of the method, a standard stochastic optimal control problem is solved by dynamic programming. Two academical examples are investigated.

研究の動機と目的

  • 状態の最終確率分布に依存する非線形制約付き確率的制御問題に対する必要最適性条件を導出すること。
  • 確率的制御における分布制約の構造を捉える変分不等式形式の最適性を確立すること。
  • 導出された最適性条件に基づく反復的増大ラグランジュ法の開発および分析すること。
  • 各部分問題を動的計画法で解ける標準的な確率的最適制御問題に還元することにより、収束性および実用的可解性を保証すること。
  • リスク回避的および分散制約付き制御目的を含む学術的例題を用いて、手法の妥当性を検証すること。

提案手法

  • 目的関数 $ F(m_T) $ を最終分布 $ m_T $ に関して最小化する制御問題を定式化し、不等式制約 $ G(m_T) \leq 0 $ を課す。ここで $ F $ および $ G $ は分布空間上の非線形汎関数である。
  • 到達可能確率分布の集合の凸性の性質を用いて、変分不等式形式の必要最適性条件を導出する。
  • 双対変数を反復的に更新し、動的計画法を用いて一連の無制約確率的制御問題を解く増大ラグランジュ法を導入する。
  • Wasserstein-1($ d_1 $-距離)の双対表現を用いて、分布関数の収束性および連続性を分析する。
  • 特にプロホロフの定理およびモーメントの有界性を用いて、$ \mathcal{P}_1(\mathbb{R}^n) $ におけるコンパクト性および連続性の結果を適用し、最適化経路の適切な定義を保証する。
  • フィッシャー=プランク方程式を用いて、フィードバック制御下での状態分布の時間発展を記述し、分布ダイナミクスの解析を可能にする。

実験結果

リサーチクエスチョン

  • RQ1非線形かつ分布制約付き確率的制御問題の解を特徴付ける変分的最適性条件は何か?
  • RQ2到達可能最終分布集合の凸性は、最適性の必要条件を導出するためにどのように利用可能か?
  • RQ3このような非線形かつ分布制約付き問題を反復的に解くための増大ラグランジュ法を設計可能か?
  • RQ4導出された最適性条件の下で、提案された反復的手法にどのような収束保証が得られるか?
  • RQ5分布関数の連続性およびコンパクト性の性質は、制御問題の可解性および安定性にどのように影響するか?

主な発見

  • 本稿では、最終時刻における分布的目的を持つ非線形制約付き確率的制御問題に対して、変分不等式が必要最適性条件として確立された。
  • 到達可能最終分布の集合が凸性を有することを示し、これが最適性条件の導出に不可欠であることが明らかになった。
  • 各反復で動的計画法を用いて標準的な確率的制御問題を解く増大ラグランジュ法が提案され、導出された条件下で収束性が保証された。
  • 2つの学術的例題を用いた検証により、リスク回避的および分散制約付き制御問題への適用可能性が示された。
  • $ \mathcal{P}_1(\mathbb{R}^n) $ 上の線形汎関数の $ L^p $-モーメントの有界性の下での連続性が証明され、最適化経路の安定性が保証された。
  • $ L^p $-モーメントの有界な部分集合が $ d_1 $-位相においてコンパクトであることが確立され、収束解析および数値実装を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。