[論文レビュー] Towards General Function Approximation in Zero-Sum Markov Games
本稿は、一般関数近似を用いた2人零和マルコフゲームにおける証明可能に効率的なアルゴリズムを提案し、関数クラスの複雑さを測る指標としてミニマックス・イリューダー次元を導入する。線形関数設定において、先行研究より √d 要因改善されたレグレットバウンドを達成し、一般化されたワーチャー・ランクを用いてサンプル複雑度のバウンドを確立することで、ニューラルネットワークや一般化線形モデルを用いたデカップルドおよび協調的設定においてもサンプル効率的な学習を可能にする。
This paper considers two-player zero-sum finite-horizon Markov games with simultaneous moves. The study focuses on the challenging settings where the value function or the model is parameterized by general function classes. Provably efficient algorithms for both decoupled and {coordinated} settings are developed. In the {decoupled} setting where the agent controls a single player and plays against an arbitrary opponent, we propose a new model-free algorithm. The sample complexity is governed by the Minimax Eluder dimension -- a new dimension of the function class in Markov games. As a special case, this method improves the state-of-the-art algorithm by a $\sqrt{d}$ factor in the regret when the reward function and transition kernel are parameterized with $d$-dimensional linear features. In the {coordinated} setting where both players are controlled by the agent, we propose a model-based algorithm and a model-free algorithm. In the model-based algorithm, we prove that sample complexity can be bounded by a generalization of Witness rank to Markov games. The model-free algorithm enjoys a $\sqrt{K}$-regret upper bound where $K$ is the number of episodes.
研究の動機と目的
- 一般関数近似を用いた競合的強化学習における理論と実装のギャップを埋めること。
- デカップルドおよび協調的設定の両方において、ゼロ和マルコフゲームに対する証明可能に効率的なアルゴリズムを開発すること。
- 競合的環境における関数クラスのための新たな複雑度測度として、ミニマックス・イリューダー次元と一般化されたワーチャー・ランクを導入すること。
- 状態空間のサイズに依存しないサンプル複雑度およびレグレットのバウンドを確立すること。
- 分布シフトの課題を伴うマルチエージェント・マルコフゲームに、オプtimisticプランニングの原則を拡張すること。
提案手法
- ゼロ和マルコフゲームにおける関数クラスのための新たな複雑度測度としてミニマックス・イリューダー次元を導入する。
- 分布シフトを管理するために、交互なオプティミズムと制約集合を用いたデカップルド設定におけるモデルフリーなアルゴリズムを提案する。
- サンプル複雑度をバウンドするために一般化されたワーチャー・ランクを用いた協調的設定におけるモデルベースのアルゴリズムを開発する。
- 推定誤差を制御し、オプティミズムを保証するために、グローバル・オプティミズムと制約集合、楕円体ポテンシャルの議論を採用する。
- 累積誤差制御と楕円体ポテンシャル補題を用いて、レグレットをバウンドし、収束を保証する。
- マルコフゲームにおけるマルチエージェント相互作用を扱うために、MDPから拡張された集中度および情報利得の手法を適用する。
実験結果
リサーチクエスチョン
- RQ1一般関数近似を用いたゼロ和マルコフゲームにおける証明可能に効率的なアルゴリズムを開発することは可能か?
- RQ2分布シフトを回避し収束を保証するために、マルコフゲームにおけるオプティミズムはどのように適合させられるか?
- RQ3関数近似を伴う競合的強化学習におけるサンプル効率性を特徴付けるために、どのような新たな複雑度測度が必要か?
- RQ4ミニマックス・イリューダー次元は、カバー数やワーチャー・ランクといった既存の測度とどのように関係するか?
- RQ5提案されたアルゴリズムは、状態空間サイズに依存しないレグレットおよびサンプル複雑度のバウンドを達成できるか?
主な発見
- デカップルド設定におけるモデルフリーなアルゴリズムは、レグレットバウンド Õ(H√(d_E K log N_F)) を達成する。ここで d_E はミニマックス・イリューダー次元、N_F は関数クラスのカバー数である。
- d次元特徴を用いた線形関数近似では、先行研究より √d 要因改善されたレグレットが達成される。
- 協調的設定では、モデルベースのアルゴリズムが ε-近似のナッシュ均衡に到達するため Õ(H³W²/ε²) のサンプル数を必要とする。ここで W は一般化されたワーチャー・ランクである。
- 協調的設定におけるモデルフリーなアルゴリズムは、d をミニマックス・イリューダー次元の変種、N_Π をポリシークラスのカバー数として、Õ(H√(dK log(N_F N_Π))) のレグレットを負担する。
- ミニマックス・イリューダー次元は、表形式ゲーム(Õ(|S||A|²))および過パラメータ化されたニューラルネットワーク(NTK領域における臨界情報ゲインを用いて)で有界である。
- 一般化線形モデルでは、標準的な正則性条件の下で、ミニマックス・イリューダー次元は O(d(c₂/c₁)² log(c₂R/(c₁ε))) で有界である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。