Skip to main content
QUICK REVIEW

[論文レビュー] Fitted Q-Learning in Mean-field Games.

Berkay Anahtarcı, Can Deha Karıksız|arXiv (Cornell University)|Dec 31, 2019
Stochastic processes and financial applications被引用数 9
ひとこと要約

本稿では、モデルありおよびモデルなしの設定において、Banachの不動点定理を用いて平均場ゲームにおける近似ナッシュ均衡を計算するためのフィットドQ学習アルゴリズムを提案する。確率的収束を確立し、学習済み平均場方策から有限エージェントゲームの均衡を構築する。

ABSTRACT

In the literature, existence of equilibria for discrete-time mean field games has been in general established via Kakutani's Fixed Point Theorem. However, this fixed point theorem does not entail any iterative scheme for computing equilibria. In this paper, we first propose a Q-iteration algorithm to compute equilibria for mean-field games with known model using Banach Fixed Point Theorem. Then, we generalize this algorithm to model-free setting using fitted Q-iteration algorithm and establish the probabilistic convergence of the proposed iteration. Then, using the output of this learning algorithm, we construct an approximate Nash equilibrium for finite-agent stochastic game with mean-field interaction between agents.

研究の動機と目的

  • 既存の方法が非構成的固定点定理に依存する離散時間平均場ゲームにおける均衡を計算する反復的アルゴリズムの開発を目的とする。
  • 実用的適用性を高めるために、モデルあり設定からのQイテレーションをフィットドQイテレーションを用いてモデルなし設定へ拡張することを目的とする。
  • モデルなし設定における提案学習アルゴリズムの確率的収束を確立することを目的とする。
  • 学習済み平均場方策が、平均場相互作用を有する有限エージェント確率的ゲームにおいて、近似ナッシュ均衡を構築するのにどのように利用できるかを示すこと。

提案手法

  • Banach不動点定理に基づくQイテレーションアルゴリズムを提案し、モデルあり平均場ゲーム均衡の計算を実現する。
  • 関数近似を用いたフィットドQイテレーションを導入することで、Qイテレーションをモデルなし設定へ一般化する。
  • 弱い正則性条件の下で、フィットドQイテレーションの確実収束を示すための確率的収束解析を採用する。
  • 学習済み平均場方策を用いて、有限エージェントゲームにおける近似ナッシュ均衡を形成する戦略プロファイルを導出する。
  • モデルなし設定における高次元状態空間の処理のため、関数近似を適用する。
  • 価値関数空間における収縮写像の原理を活用することで、理論的収束を確立する。

実験結果

リサーチクエスチョン

  • RQ1Banachの不動点定理を用いて、Qイテレーションを平均場ゲームにおける均衡計算に適応できるか?
  • RQ2モデルなし設定において、フィットドQイテレーションは平均場ゲームで収束するか?
  • RQ3平均場Q学習アルゴリズムの出力は、どのようにして有限エージェントナッシュ均衡を構築できるか?
  • RQ4平均場設定におけるフィットドQイテレーションの収束に対して、どのような理論的保証を提供できるか?
  • RQ5構築された方策が、有限エージェントゲームにおいて有効な近似ナッシュ均衡を形成するための条件は何か?

主な発見

  • 提案されたQイテレーションアルゴリズムは、Banachの不動点定理の条件を満たす限り、平均場ゲームにおいて均衡方策に収束する。
  • フィットドQイテレーションはモデルなし設定において確率的収束を達成し、価値関数推定の確実収束を保証する。
  • 学習済み平均場方策は、有限エージェント確率的ゲームにおいて近似ナッシュ均衡を形成する戦略プロファイルを生成する。
  • 遷移モデルの明示的知識が不要であるため、均衡計算が実用的応用に適している。
  • 理論的枠組みにより、高次元設定における関数近似の使用が可能であり、収束保証を維持できる。
  • 構成的で学習ベースの均衡計算手法を提供することで、平均場ゲーム理論と強化学習を橋渡しする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。