Skip to main content
QUICK REVIEW

[論文レビュー] Discrete-time Risk-sensitive Mean-field Games

Naci Saldı, Tamer Başar|arXiv (Cornell University)|Aug 12, 2018
Stochastic processes and financial applications参考文献 2被引用数 5
ひとこと要約

本稿は、無限ホライズン割引コスト基準の下で、指数的効用を用いてリスクセンシティブ性をモデル化することにより、離散時間リスクセンシティブ平均場ゲームにおける平均場均衡の存在を確立する。平均場均衡方策が、大きなが有限な集団において近似的ナッシュ均衡を形成することを証明し、一般のポーランド状態および制御空間と有界なコスト関数を用いた離散時間において、リスクセンシティブ制御を平均場ゲーム理論へ初めて拡張する。

ABSTRACT

In this paper, we study a class of discrete-time mean-field games under the infinite-horizon risk-sensitive discounted-cost optimality criterion. Risk-sensitivity is introduced for each agent (player) via an exponential utility function. In this game model, each agent is coupled with the rest of the population through the empirical distribution of the states, which affects both the agent's individual cost and its state dynamics. Under mild assumptions, we establish the existence of a mean-field equilibrium in the infinite-population limit as the number of agents ($N$) goes to infinity, and then show that the policy obtained from the mean-field equilibrium constitutes an approximate Nash equilibrium when $N$ is sufficiently large.

研究の動機と目的

  • リスクセンシティブなコスト基準を有する離散時間システムにおける平均場ゲーム理論を拡張すること。リスクセンシティブ性は指数的効用を用いてモデル化する。
  • 一般のポーランド状態および制御空間と有界な1ステージコストを用いた無限集団極限における平均場均衡の存在を確立すること。
  • 平均場均衡方策が、十分に大きく有限な数のエージェントを有するゲームにおいて近似的ナッシュ均衡を構成することを示すこと。
  • 連続時間リスクセンシティブ平均場ゲームとその離散時間対応物との間のギャップを埋めること。これまでの研究は主にリスクニュートラルな設定に限られていた。

提案手法

  • 各エージェントのコストおよびダイナミクスが集団の状態の経験的分布に依存する離散時間平均場ゲームモデルを定式化する。
  • 指数的効用関数を導入することでリスクセンシティブ性をモデル化し、各エージェントのリスクセンシティブ割引コスト基準を導出する。
  • ナッシュ確実性等価(NCE)原理を適用して、無限集団ゲームを分布制約付きの単一エージェント確率的制御問題に分解する。
  • フォッカー=プランク方程式を用いて極限状態分布の時間発展を記述し、ハミルトニアン=ジャコビ=ベルマン(HJB)方程式を用いて最適方策を特徴付ける。
  • 確率測度の弱収束および一様等連続性の議論を用いて、経験的分布の収束を証明する。
  • 平均場均衡方策の下でエージェント状態の経験的分布が極限分布に収束することを確立し、一貫性を保証する。

実験結果

リサーチクエスチョン

  • RQ1一般のポーランド状態および制御空間と有界なコスト関数を用いた離散時間リスクセンシティブ平均場ゲームにおいて、平均場均衡は存在するか?
  • RQ2平均場均衡から導かれる方策は、十分に大きく有限な数のエージェントを有するゲームにおいて近似的ナッシュ均衡として機能するか?
  • RQ3指数的効用を用いてモデル化されるリスクセンシティブ性は、離散時間平均場ゲームにおける均衡の構造および存在にどのように影響するか?
  • RQ4無限集団極限において、エージェント状態の経験的分布が極限分布に収束するための条件は何か?
  • RQ5遷移核およびコスト関数の性質は、平均場均衡の安定性および連続性にどのように影響するか?

主な発見

  • 本稿は、一般のポーランド状態および制御空間と有界な1ステージコストを有する離散時間リスクセンシティブ平均場ゲームにおいて、無限集団極限における平均場均衡の存在を証明する。
  • 平均場均衡方策が、十分に大きく有限な数のエージェントを有するゲームにおいて近似的ナッシュ均衡を構成することが示された。
  • 弱収束および一様等連続性の議論を用いて、エージェント状態の経験的分布が極限分布に収束することが確立された。
  • 価値関数の族および遷移核の族が一様有界かつ一様等連続であることが示され、極限における安定性が保証された。
  • 証明は、最初のエージェントの状態の経験的分布が極限分布に一様収束することに依存しており、これはNCE原理の検証における重要なステップである。
  • コスト関数の有界性および平均場項における遷移核およびコスト関数の連続性という、緩い仮定の下でも結果が成立する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。