Skip to main content
QUICK REVIEW

[論文レビュー] On Zero-Sum Stochastic Differential Games

Erhan Bayraktar, Song Yao|arXiv (Cornell University)|Dec 24, 2011
Stochastic processes and financial applications参考文献 4被引用数 9
ひとこと要約

本稿は、離散近似の代わりに被覆論法を用いることで、有界でない二階可積分制御を伴うゼロ和確率的微分ゲームに対する動的計画法の原則を確立し、報酬を2階の二重に反映された後向き stochastic 微分方程式(DRBSDE)を介して定義する。主な貢献は、コンパクトな制御空間を必要としていなかった先行研究を拡張し、障害項を伴う完全非線形PDEの粘性解としての価値関数の存在と一意性を証明することにある。

ABSTRACT

We generalize the results of Fleming and Souganidis (1989) on zero sum stochastic differential games to the case when the controls are unbounded. We do this by proving a dynamic programming principle using a covering argument instead of relying on a discrete approximation (which is used along with a comparison principle by Fleming and Souganidis). Also, in contrast with Fleming and Souganidis, we define our pay-off through a doubly reflected backward stochastic differential equation. The value function (in the degenerate case of a single controller) is closely related to the second order doubly reflected BSDEs.

研究の動機と目的

  • FlemingとSouganidisのゼロ和確率的微分ゲームに関する結果を、有界でない制御の状況に一般化すること。
  • 先行研究で用いられた離散近似法の代わりに、被覆論法を用いて動的計画法の原則を証明すること。
  • 2階の二重に反映された後向き確率微分方程式(DRBSDE)を用いて、ゲームの報酬を定義し、有界でない制御制約下での価値関数の解析を可能にすること。
  • 価値関数を障害項を伴う完全非線形PDEの粘性解として確立すること。
  • 確率的微分ゲーム理論の適用範囲を、コンパクトな制御空間にとどまらない、より広範かつ現実的な制御設定へと拡張すること。

提案手法

  • 離散近似スキームに依存しない動的計画法の原則を証明するために、被覆論法を用いる。
  • ゲームの終端報酬と制約をモデル化するため、2階の二重に反映された後向き確率微分方程式(DRBSDE)を通じて報酬を定義する。
  • 確率測度下での可測性と可積分性を保証するために、シフト過程と制御の貼り合わせ技術を適用する。
  • 条件付き確率分布と標準確率空間を用いて、任意の出発時刻 t ∈ [0, T] からのゲームダイナミクスをモデル化する。
  • 粘性解理論を用いて、下位および上位の反射バリアを伴う完全非線形PDEの解としての価値関数の特徴づけを行う。
  • Girsanovの定理とマルティンゲール表現を活用して、測度変更および時間シフト下でも、価値関数とDRBSDEの解との間の同値性を確立する。

実験結果

リサーチクエスチョン

  • RQ1有界でない制御を伴うゼロ和確率的微分ゲームに対して、離散近似に依存せずに動的計画法の原則を確立できるか?
  • RQ2制御が二乗可積分的であり、コンパクトにサポートされていない場合、このようなゲームにおける報酬を一貫して定義できるか?
  • RQ3有界でない制御を伴うゼロ和ゲームの価値関数と2階の二重に反映されたBSDEとの関係は何か?
  • RQ4単一の制御者が存在する退化ケースにおいて、障害項を伴う完全非線形PDEの粘性解としての価値関数は成立するか?
  • RQ5シフト過程と制御の貼り合わせは、確率的制御枠組みにおいて可測性と可積分性をどのように保証するか?

主な発見

  • 有界でない二乗可積分制御を伴うゼロ和確率的微分ゲームに対して、離散近似に依存せず、被覆論法を用いて動的計画法の原則が成立することが示された。
  • 価値関数が下位および上位の反射バリアを伴う完全非線形PDEの唯一の粘性解であることが証明され、古典的結果が有界でない制御へと拡張された。
  • 報酬は2階の二重に反映されたBSDEを介して厳密に定義され、ゲームの終端報酬と経路に沿った制約を捉えている。
  • DRBSDEの解はゲームの価値関数と同値であり、測度変更および時間シフト下でもこの同値性が保たれる。
  • 本稿では、制御の貼り合わせに関して価値関数が安定していることが確立され、確率的制御における動的計画法の重要な性質が得られた。
  • 解析により、価値関数がブラウン運動と制御過程が生成するフィルトレーションに関して可測かつ逐次可測であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。