[論文レビュー] Dynamic Programming Principles for Optimal Stopping with Expectation Constraint
本稿は、累積費用に期待値制約を課した最適停止問題における動的計画法(DPP)を確立し、値関数の連続性を証明するとともに、完全非線形放物型ハミルトニアン・ジャコビ・ベルマン方程式の粘性解として特徴づける。主な革新は、条件付き期待費用を追加の状態過程として導入することで、制約付き最適停止問題における未解決問題を解消するDPPを可能にしたことである。
We analyze an optimal stopping problem with a constraint on the expected cost. When the reward function and cost function are Lipschitz continuous in state variable, we show that the value of such an optimal stopping problem is a continuous function in current state and in budget level. Then we derive a dynamic programming principle (DPP) for the value function in which the conditional expected cost acts as an additional state process. As the optimal stopping problem with expectation constraint can be transformed to a stochastic optimization problem with supermartingale controls, we explore a second DPP of the value function and thus resolve an open question recently raised in [S. Ankirchner, M. Klein, and T. Kruse, A verification theorem for optimal stopping problems with expectation constraints, Appl. Math. Optim., 2017, pp. 1-33]. Based on these two DPPs, we characterize the value function as a viscosity solution to the related fully non-linear parabolic Hamilton-Jacobi-Bellman equation.
研究の動機と目的
- 累積費用に期待値制約を課した最適停止問題における動的計画法の欠如に応えること。
- リプシッツ連続性および非退化性の条件下で、状態変数および予算変数に関して値関数の連続性を確立すること。
- 制約付き最適停止問題におけるDPPに関する未解決問題を、補助的状態過程としての条件付き期待費用を導入することにより解決すること。
- 値関数を完全非線形放物型HJB方程式の粘性解として特徴づけること。
- 制約付き最適停止問題を、下界過程を伴う確率的制御問題に変換し、第二のDPPを導出すること。
提案手法
- 条件付き期待費用を追加の状態過程として扱い、シフトされたストキャスティック微分方程式およびフロー性質を用いてDPPを導出する。
- 事前推定および近似停止戦略を用いて、(t, x, y)における値関数の連続性を証明する。
- 正規条件付き確率分布および状態過程のマルコフ性を用いて、DPPの「≤」方向を確立する。
- 局所的停止ルールを貼り合わせることでε-最適戦略を構築し、値関数の連続性を活用してDPPの「≥」方向を証明する。
- 予算レベルyから出発する、下界過程を伴う非制約的確率的制御問題に変換することで、制約付き最適停止問題を解釈する。
- 値関数を完全非線形放物型HJB方程式の粘性解として特徴づけ、モンジュ=アンプère型構造を含む。
実験結果
リサーチクエスチョン
- RQ1累積費用に期待値制約を課した最適停止問題に対して、動的計画法(DPP)を確立できるか?
- RQ2リプシッツ連続性および非退化性の条件下で、状態変数および予算水準に関して値関数は連続的か?
- RQ3条件付き期待費用を状態過程として統合することで、この制約付き設定におけるDPPを可能にする方法は何か?
- RQ4制約付き問題を、下界過程を伴う確率的制御問題に再定式化し、第二のDPPを導出できるか?
- RQ5値関数は完全非線形放物型ハミルトニアン・ジャコビ・ベルマン方程式の粘性解か?
主な発見
- f, π, gのリプシッツ連続性およびgの非退化性の下で、値関数V(t, x, y)は(t, x, y)に関して連続である。
- 条件付き期待費用Y^{t,x,τ}_sを追加の状態過程として扱うことで、DPPが確立され、次式の形をとる:V(t,x,y) = sup_E[1_{τ≤ζ(τ)} R(t,x,τ) + 1_{τ>ζ(τ)} (V(ζ(τ), X^{t,x}_{ζ(τ)}, Y^{t,x,τ}_{ζ(τ)}) + ∫_t^{ζ(τ)} f(r,X^{t,x}_r) dr)]。
- 値関数は、モンジュ=アンプère型構造を含む完全非線形放物型ハミルトニアン・ジャコビ・ベルマン方程式の粘性解として特徴づけられる。
- 制約付き問題を、下界過程を伴う非制約的確率的制御問題に変換することで、第二のDPPが導出され、[Ankirchner et al., 2017]における未解決問題が解決される。
- Vの連続性のおかげで、貼り合わせによるε-最適停止戦略が構築可能であり、これはDPPの逆不等式の証明に不可欠である。
- 値関数は有限かつ可測であり、E_t[K_*] < ∞を満たすため、動的計画法フレームワークの有効性が保証される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。