[論文レビュー] Dynamic Set Values for Nonzero Sum Games with Multiple Equilibriums
本稿は、複数のナッシュ均衡を有する非ゼロ和確率的微分ゲームに対して、動的集合価値を導入し、それをすべての均衡配当の集合として定義する。閉ループで経路に依存する制御を用いて動的プログラミング原理(DPP)を確立し、集合価値が経路に依存するPDEを満たすことを示し、数値計算が可能であり、正則性および安定性を保証する。
Nonzero sum games typically have multiple Nash equilibriums (or no equilibrium), and unlike the zero sum case, they may have different values at different equilibriums. Instead of focusing on the existence of individual equilibriums, we study the set of values over all equilibriums, which we call the set value of the game. The set value is unique by nature and always exists (with possible value $\emptyset$). Similar to the standard value function in control literature, it enjoys many nice properties such as regularity, stability, and more importantly the dynamic programming principle. There are two main features in order to obtain the dynamic programming principle: (i) we must use closed-loop controls (instead of open-loop controls); (ii) we must allow for path dependent controls, even if the problem is in a state dependent (Markovian) setting. We shall consider both discrete and continuous time models with finite time horizon. For the latter we will also provide a duality approach through certain standard PDE (or path dependent PDE), which is quite efficient for numerically computing the set value of the game.
研究の動機と目的
- 非ゼロ和確率的微分ゲームにおいて、複数の均衡が存在するか、あるいは均衡が存在しない場合に生じる課題に対処すること。この場合、個々の均衡は異なる配当をもたらす可能性がある。
- すべての均衡配当を集約して1つの集合(集合価値)として定義することで、一意的かつ良好に定義されたゲーム価値を確立すること。集合価値は常に存在する(空集合である可能性を含む)。
- 離散的および連続的時間モデルにおいて、時間的一致性と正則性を保証するように、この集合価値に対する動的プログラミング原理(DPP)を確立すること。
- オープンループ制御や状態に依存する制御ではDPPが成立しないことの証明を行い、マルコフ的設定下でも経路に依存する閉ループ戦略が不可欠であることを示すこと。
- 連続時間モデルにおいて、集合価値の効率的な数値計算を可能にする、経路に依存するPDE(PPDE)に基づく双対的アプローチを提供すること。
提案手法
- 集合価値は、すべてのナッシュ均衡における配当の集合として定義され、構成上、存在および一意性が保証される。
- 動的プログラミング原理は、状態と時間に依存する閉ループ制御を用いて確立され、オープンループ制御とは異なる。
- 均衡価値の非一意性のため、DPPが成立するには経路に依存する制御が不可欠であり、マルコフ的設定下でも同様である。
- 連続時間では、集合価値は退化した拡散項と有界でない制御をもつ経路に依存するハミルトニアン・ジャコビ・ベルマン(PPDE)方程式の粘性解として特徴づけられる。
- 状態に依存する場合に標準的なHJB方程式に還元される、経路に依存するPDE(PPDE)を用いた双対的アプローチが開発された。
- この手法により、特に複数の均衡が存在する場合に、PPDEの解を用いて集合価値の数値計算が可能となる。
実験結果
リサーチクエスチョン
- RQ1複数のナッシュ均衡が存在する非ゼロ和確率的微分ゲームにおいて、一意的なゲーム価値を定義することは可能か?
- RQ2非ゼロ和ゲームの均衡配当の集合に対して、動的プログラミング原理(DPP)が成立する条件は何か?
- RQ3非ゼロ和ゲームでは、制御問題やゼロ和ゲームとは異なり、なぜ閉ループで経路に依存する制御がDPPが成立するために不可欠なのか?
- RQ4複数の均衡が存在する連続時間モデルにおいて、集合価値はどのように数値的に計算できるか?
- RQ5集合価値と後向き確率微分方程式(BSDE)や経路に依存するPDEの解との関係は何か?
主な発見
- 集合価値は、個々の均衡が存在しない場合や、異なる配当をもたらす場合でも、常に良好に定義され、一意的である。
- 動的プログラミング原理(DPP)は、集合価値に対して、閉ループで経路に依存する制御が用いられる場合にのみ成立する。オープンループ制御や状態に依存する制御では成立しない。
- 集合価値は経路に依存するPDE(PPDE)を満たし、これは退化しており、制御が有界でない。また、方程式 (3.57) の粘性解として特徴づけられる。
- マルコフ的(状態に依存する)な場合、PPDEは式 (3.57)(ii) に示されるように、標準的なHJB方程式に簡略化される。
- PPDEは、連続時間モデルにおける集合価値の効率的数値計算のための双対的アプローチを提供する。特に、複数の均衡が存在する場合に有効である。
- BSDEとの関係が確立された:適切な条件下では、すべての均衡配当は、経路に依存する係数をもつ多次元BSDEの解を用いて構成可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。