[論文レビュー] The Relaxed Stochastic Maximum Principle in the Mean-field Singular Controls
本稿は、状態とその期待値に依存する動的およびコスト関数を伴う、特異制御を伴う平均場型SDEにおける緩和された確率的最適性原理を確立する。スパイク変動とエケランの変分原理を組み合わせることで、随伴方程式と変分不等式を介して測度値制御のための必要最適性条件を導出する。これは、特異成分を有する時間不一致な平均場設定における古典的確率的最適性原理の拡張である。
In this paper, we study the optimal control system driven by stochastic differential equations (SDEs) of mean-field type, in which the control variable has two components, the first being absolutely continuous and the second singular. On the other hand, the coefficients depend on the state of the solution process as well as of its expected value. Moreover, the cost functional is also of mean field type. This makes the control problem time inconsistent in the sense that the Bellman optimality principle does not hold. Our aim is to derive a stochastic maximum principle of optimal control of Pontriagin type to the class of measure-valued controls.
研究の動機と目的
- 期待値に依存する係数によりベルマンの原理が失敗する、期待値依存係数を有する平均場型SDEにおける時間不一致最適制御問題に対処すること。
- 絶対連続制御および特異制御成分を含む、特異制御問題への確率的最適性原理の拡張すること。
- 状態および期待値依存性を有する平均場設定における測度値制御(測度値制御)のための必要最適性条件の開発すること。
- 平均場SDEによって近似可能な相互作用粒子系における最適制御のためのフレームワークを確立すること。
- 既存の特異制御に関する結果を、特に非凸制御領域において、平均場設定に一般化すること。
提案手法
- 状態およびその期待値に依存する係数を有する、ドリフト項、拡散項および特異制御成分を有する平均場型SDEを定式化する。
- コスト関数もまた平均場型であることを導入し、時間不一致を引き起こす。
- 絶対連続制御にスパイク変動を適用し、特異制御に凸変動を適用することで、一次の必要最適性条件を導出する。
- エケランの変分原理を用いて、緩和制御に収束する厳密制御の近似的最適性条件を導出する。
- 制御収束下での軌道および随伴過程の安定性を確立し、緩和された最適性原理の導出を可能にする。
- 随伴後向き確率微分方程式(BSDE)および特異制御成分のための変分不等式を有する確率的ハミルトニアン系を導出する。
実験結果
リサーチクエスチョン
- RQ1ベルマンの原理が時間不一致のため失敗する平均場型SDEにおける特異制御を伴う最適制御問題において、必要最適性条件をどのように導出できるか。
- RQ2測度値制御を伴う平均場特異制御問題の文脈において、随伴後向き確率微分方程式の構造はどのようなものか。
- RQ3平均場型SDEにおける緩和制御フレームワーク下で、最適制御と随伴過程はどのように相互作用するか。
- RQ4平均場特異制御設定において、随伴過程の存在および一意性を保証する条件は何か。
- RQ5特異制御の変分不等式条件は、ハミルトニアンおよび随伴変数の観点からどのように特徴づけられるか。
主な発見
- 本稿は、平均場特異制御問題における緩和された確率的最適性原理を確立し、ハミルトニアン系を用いた必要最適性条件を提供する。
- 最適制御は、ハミルトニアンの制御集合上での最小化条件を満たし、制御値および測度値制御の両方の最小化として表現される。
- 随伴過程は、状態およびその期待値によって駆動される後向き確率微分方程式(BSDE)を満たし、前向き平均場SDEと整合性を保つ。
- 特異制御成分は、随伴過程および制御のジャンプ成分を含む変分不等式を満たし、ハミルトニアンの増分が非負となることを保証する。
- 厳密制御の緩和制御への収束は、軌道および随伴過程の安定性により確立され、緩和された最適性原理の導出を可能にする。
- 結果として、特に非凸制御領域下において、古典的確率的最適性原理が平均場設定に特異制御を含めて一般化される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。