Skip to main content
QUICK REVIEW

[論文レビュー] From Poincaré Recurrence to Convergence in Imperfect Information Games: Finding Equilibrium via Regularization

Julien Pérolat, Rémi Munos|arXiv (Cornell University)|Feb 19, 2020
Reinforcement Learning in Robotics参考文献 54被引用数 17
ひとこと要約

本稿は、正規形ゲームから逐次的非完全情報ゲーム(IIGs)へのポincare再帰の拡張を試み、フォローザ・レギュライズド・リーダー(FoReL)ダイナミクスがこのような設定でも循環し得ることを示している。正則化による報酬変換を導入することで、単調かつゼロサムIIGsにおいて強い収束性を達成し、NeuRDなどの最先端のモデルフリー深層強化学習アルゴリズムが実時間で均衡戦略に収束することを可能にした。

ABSTRACT

In this paper we investigate the Follow the Regularized Leader dynamics in sequential imperfect information games (IIG). We generalize existing results of Poincaré recurrence from normal-form games to zero-sum two-player imperfect information games and other sequential game settings. We then investigate how adapting the reward (by adding a regularization term) of the game can give strong convergence guarantees in monotone games. We continue by showing how this reward adaptation technique can be leveraged to build algorithms that converge exactly to the Nash equilibrium. Finally, we show how these insights can be directly used to build state-of-the-art model-free algorithms for zero-sum two-player Imperfect Information Games (IIG).

研究の動機と目的

  • 非完全情報ゲーム(IIGs)における深層強化学習の実時間収束の欠如に取り組み、時間平均戦略は収束するが、実際の戦略は収束しないという問題を解決すること。
  • 正規形ゲームにおけるPoincaré再帰の理論的結果を逐次的IIGsに拡張し、FoReLダイナミクスがこのような設定でも循環し得ることを示すこと。
  • 正則化による報酬構造の変更が、単調およびゼロサムゲームにおける収束保証をどのように改善するかを調査すること。
  • 報酬変換を用いて、擬似解を繰り返し精錬することで正確なナッシュ均衡に近づける手法を開発すること。
  • これらの理論的知見を活用し、実用的でスケーラブルな非モデルベース深層強化学習アルゴリズム(NeuRD)を設計・評価し、IIGsにおける最先端のパフォーマンスを達成すること。

提案手法

  • 単調性およびゼロサム構造の仮定の下で、FoReLダイナミクスの分析を通じて、逐次的IIGsへのPoincaré再帰の一般化を試みる。
  • ゲームの報酬構造を安定化させ、収束を強制するための報酬変換(正則化)を導入する。
  • 正則化パラメータを次第に高精度にする一連の手順により、真のナッシュ均衡に収束する擬似解の系列を生成する。
  • 正則化報酬関数を用いたQ学習更新の適応を含め、価値ベースの深層強化学習アルゴリズムに正則化技術を適用する。
  • ポリシーとQ値推定のための別々のネットワークを有する2ストリームアーキテクチャを採用し、経験再生とターゲットネットワークを用いて訓練する、非モデルベースの深層強化学習アルゴリズムNeuRDを実装する。
  • 正則化パラメータ(eta)の指数的減衰と適応的スケジューリングを導入し、大規模なIIGsにおける訓練の安定性と収束性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1正規形ゲームで知られているPoincaré再帰は、逐次的非完全情報ゲームに一般化可能か?
  • RQ2報酬正則化は、単調およびゼロサムIIGsにおけるFoReLダイナミクスの収束特性にどのように影響するか?
  • RQ3元のゲームのナッシュ均衡に収束するように、正則化されたゲームの系列を構築可能か?
  • RQ4報酬正則化は、大規模なIIGsにおける深層RL戦略の実時間収束をどの程度可能にするか?
  • RQ5正則化からの理論的知見は、実用的でスケーラブルな非完全情報ゲーム向け深層強化学習アルゴリズムに効果的に転送可能か?

主な発見

  • Poincaré再帰は、2人ゼロサム非完全情報ゲームの逐次的設定に一般化され、FoReLダイナミクスがこのような設定でも循環し得ることが証明された。
  • 報酬正則化は、元のゲームのダイナミクスが再帰的であっても、戦略がナッシュ均衡に収束することを保証するようにゲームを変換する。
  • 正則化されたゲームの系列を構築し、その均衡が元のゲームのナッシュ均衡に収束するようにすることで、繰り返しの精錬による正確な収束が可能になった。
  • 提案された正則化フレームワークに基づく深層強化学習アルゴリズムNeuRDは、Kuhnポーカー、Leducポーカー、Liars Dice、GoofSpielにおいて最先端のパフォーマンスを達成し、実時間で均衡戦略に収束した。
  • 実験では、正則化パラメータ(eta)の適応的および指数的減衰スケジューリングが、複数のIIGsにおいて訓練の安定性と収束速度を顕著に向上させた。
  • 全テスト環境において、正則化を用いて訓練された戦略は実時間でナッシュ均衡に収束したが、標準的なFoReLでは再帰的挙動を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。