Skip to main content
QUICK REVIEW

[論文レビュー] Convergence of Deep Fictitious Play for Stochastic Differential Games

Jiequn Han, Ruimeng Hu|arXiv (Cornell University)|Aug 12, 2020
Stochastic processes and financial applications参考文献 64被引用数 13
ひとこと要約

本稿は、大規模で非対称な確率的力学的ゲームを解くためのDeep Fictitious Play (DFP)アルゴリズムの理論的収束性を確立する。ゲームを深層後向きSDEを用いて逐次的に解く部分問題に分解することにより、この手法は弱い条件下でもマークフィアンナッシュ均衡に確かに収束し、さらにε-ナッシュ均衡を形成する。実験的妥当性は技術的仮定を越えて裏付けられている。

ABSTRACT

Stochastic differential games have been used extensively to model agents' competitions in Finance, for instance, in P2P lending platforms from the Fintech industry, the banking system for systemic risk, and insurance markets. The recently proposed machine learning algorithm, deep fictitious play, provides a novel efficient tool for finding Markovian Nash equilibrium of large $N$-player asymmetric stochastic differential games [J. Han and R. Hu, Mathematical and Scientific Machine Learning Conference, pages 221-245, PMLR, 2020]. By incorporating the idea of fictitious play, the algorithm decouples the game into $N$ sub-optimization problems, and identifies each player's optimal strategy with the deep backward stochastic differential equation (BSDE) method parallelly and repeatedly. In this paper, we prove the convergence of deep fictitious play (DFP) to the true Nash equilibrium. We can also show that the strategy based on DFP forms an $\eps$-Nash equilibrium. We generalize the algorithm by proposing a new approach to decouple the games, and present numerical results of large population games showing the empirical convergence of the algorithm beyond the technical assumptions in the theorems.

研究の動機と目的

  • 大規模N人、非対称な確率的力学的ゲームを解くためのDeep Fictitious Play (DFP)アルゴリズムの理論的基盤を確立すること。
  • 部分問題が正確に解かれる場合、DFPが真のマークフィアンナッシュ均衡に収束することを証明すること。
  • 深層BSDEによる近似の数値誤差が、ネットワーク容量の増大に伴い消えることの証明。
  • 十分な反復回数と細かいメッシュ化が行われた後、DFPから得られる補間戦略がε-ナッシュ均衡を形成することの実証。
  • ゲームの分解を改善するためのポリシー更新アプローチを導入し、DFPを一般化することで、実験的収束性を向上させること。

提案手法

  • フェイクティビアスプレイまたはポリシー更新を用いて、N人ゲームをN個の独立した部分問題に分解する。
  • 各部分問題を深層BSDE法により解き、深層ニューラルネットワークを用いて後向き確率的微分方程式の解を近似する。
  • BSDEの離散化にEulerスキームを用い、勾配降下法(Adam最適化法)を用いてニューラルネットワークのパラメータを学習する。
  • 全結合層に3層の隠れ層(幅40)を用い、バッチ正規化とReLUに類似した活性化関数(tanh)を適用する。
  • 状態過程が定義域全体にわたって代表的であるように、初期状態分布を固定点手続きで設定する。
  • 真のサンプルパスを用いて制御近似の精度を評価するため、相対二乗誤差(RSE)を指標として用いる。

実験結果

リサーチクエスチョン

  • RQ1部分問題が正確に解かれる場合、Deep Fictitious Playアルゴリズムは真のマークフィアンナッシュ均衡に収束するか?
  • RQ2ネットワーク容量の増大に伴い、深層BSDEによる各部分問題の数値誤差は0に収束するか?
  • RQ3十分な反復回数と細かい時間メッシュ化が行われた後、DFPが生成する補間戦略はε-ナッシュ均衡を形成するか?
  • RQ4技術的仮定(例:係数のリプシッツ連続性)が満たされない場合でも、DFPのポリシー更新バージョンは実験的収束を達成できるか?
  • RQ5高次元の確率的力学的ゲームにおいて、深層BSDE法は価値関数およびその勾配の近似にどの程度効果的か?

主な発見

  • 部分問題が正確に解かれる場合、DFPアルゴリズムは真のマークフィアンナッシュ均衡に収束する。
  • 深層ニューラルネットワークの普遍近似能力を活用することで、深層BSDEによる近似誤差は消える。
  • 十分な段階数と十分な細かい時間メッシュ化がなされた後、DFPに基づく補間戦略はε-ナッシュ均衡を形成する。
  • 提案されたポリシー更新バージョンにより、技術的仮定(例:係数のリプシッツ連続性)が満たされない場合でも、実験的収束が達成可能である。
  • 非リプシッツ連続かつ非一様有界な係数を持つ数値例において、深層BSDE法は制御近似で相対二乗誤差(RSE)0.27%を達成した。
  • 可視化結果から、最適な状態プロセスと制御プロセスが、サンプルパス全体にわたって深層学習による近似と強く一致していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。