Skip to main content
QUICK REVIEW

[論文レビュー] Q-Learning in Regularized Mean-field Games

Berkay Anahtarcı, Can Deha Karıksız|arXiv (Cornell University)|Mar 24, 2020
Receptor Mechanisms and Signaling被引用数 4
ひとこと要約

本稿では、制限的な凸性仮定を必要とせず、強化学習におけるロバスト性と誤差解析を向上させる正則化付き平均場ゲームフレームワークを導入する。1段階報酬に強く凹関数の正則化項を組み込むことで、最適方策のリプシッツ連続性を保証するフィットドQラーニングアルゴリズムを構築し、先行研究よりも緩い条件下で収束保証が得られる。

ABSTRACT

In this paper, we introduce a regularized mean-field game and study learning of this game under an infinite-horizon discounted reward function. Regularization is introduced by adding a strongly concave regularization function to the one-stage reward function in the classical mean-field game model. We establish a value iteration based learning algorithm to this regularized mean-field game using fitted Q-learning. The regularization term in general makes reinforcement learning algorithm more robust to the system components. Moreover, it enables us to establish error analysis of the learning algorithm without imposing restrictive convexity assumptions on the system components, which are needed in the absence of a regularization term.

研究の動機と目的

  • 最小限の仮定の下で平均場ゲーム学習における収束性と誤差境界の確立という課題に取り組む。
  • 先行研究が方策のリプシッツ連続性を保証するために報酬関数の強い凸性と滑らかさを仮定していたという制限を克服する。
  • 正則化された設定における平均場均衡への収束を保証する価値反復ベースの学習アルゴリズムを開発する。
  • 正則化を活用してモデルフリーQラーニングを平均場ゲームに一般化し、方策学習の安定性を高める。
  • システム部品に制限的な凸性条件を課さずに、学習アルゴリズムの理論的誤差境界を提供する。

提案手法

  • 1段階報酬に強く凹関数を追加することで正則化付き平均場ゲームを導入し、安定性とロバスト性を向上させる。
  • 無限ホライズン割引報酬基準の下で、正則化付き平均場ゲームを解くためのフィットドQラーニングに基づく価値反復アルゴリズムを提案する。
  • 強い凸性と滑らかさの双対性を用いて、最適方策が平均場項に関してリプシッツ連続であることを確立する。
  • 誤差解析技術を用いて、最適方策の正則化価値関数とε最適方策との差をバインドする。
  • 報酬、遷移カーネル、価値関数のリプシッツ定数を用いて定量的誤差境界を導出し、収束速度を示す。
  • 有限集団ゲームの収束が平均場極限に至ることを示し、有限系におけるεナッシュ均衡が平均場均衡を近似することを示す。

実験結果

リサーチクエスチョン

  • RQ1平均場ゲームにおける正則化は、報酬関数の強い凸性を仮定しなくてもQラーニングベースのアルゴリズムの収束を可能にするか?
  • RQ2正則化は平均場分布に関して最適方策のリプシッツ連続性にどのように影響するか?
  • RQ3最小限の仮定の下で、正則化付き平均場ゲームにおけるフィットドQラーニングアルゴリズムに確立可能な誤差境界は何か?
  • RQ4正則化付き平均場ゲームフレームワークは、非正則化モデルと比較して、学習におけるロバスト性と安定性をどの程度向上させるか?
  • RQ5有限集団ゲームの均衡は、正則化された設定において、平均場均衡にどの程度収束するか?

主な発見

  • 正則化項により、最適方策が平均場分布に関してリプシッツ連続となり、最適性作用素の収縮が保証される。
  • やや緩い正則性条件の下で、$\|J_{\mu_*}^{\text{reg}}(\pi_*,\cdot) - J_{\mu_*}^{\text{reg}}(\pi_\varepsilon,\cdot)\|_{\infty} \leq \frac{C_3 \varepsilon}{1 - \beta}$ の誤差境界が確立され、ここで $C_3 = L_1 + L_{\text{reg}} + \frac{\beta K_1 K_{\text{Lip}}}{2}$ である。
  • フィットドQラーニングアルゴリズムは、報酬関数の強い凸性や滑らかさを仮定しなくても、正則化フレームワーク下で平均場均衡に収束する。
  • 最適方策とε最適方策との価値関数差の誤差境界は $\frac{C_2 \varepsilon}{1 - \beta}$ であり、ここで $C_2 = \left(L_1 + \frac{\beta K_1 K_{\text{Lip}}}{2}\right)\frac{K_1}{1 - C_1}$ であり、方策近似誤差に依存することが示された。
  • 有限集団ゲームは平均場均衡に収束し、$N \to \infty$ のとき、$J_1^{(N)}(\boldsymbol{\pi}^{(N)}) \geq \sup_{\pi^1} J_1^{(N)}(\boldsymbol{\pi}^{(N)}_{-1}, \pi^1) - \tau\varepsilon - \delta$ が十分大きな $N$ に対して成立し、εナッシュ性が漸近的に成立する。
  • このフレームワークにより、平均場均衡作用素の収縮を示すために従来必要とされていた強い凸性および滑らかさの仮定が不要になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。