Skip to main content
QUICK REVIEW

[論文レビュー] Solving Discounted Stochastic Two-Player Games with Near-Optimal Time and Sample Complexity

Aaron Sidford, Mengdi Wang|arXiv (Cornell University)|Aug 29, 2019
Reinforcement Learning in Robotics参考文献 38被引用数 17
ひとこと要約

この論文は、近似的に最適なサンプルおよび時間計算量を達成する、割引付き確率的2人ゼロ和ゲームを解くための新規アルゴリズムを提示する。$\tilde{O}((1-\gamma)^{-3}\epsilon^{-2})$ のサンプルを用い、マルコフ決定過程(MDP)における既知の最良の境界と一致する。単調性を保つ更新と分散低減を用いてQ学習を一般化することで、サンプル数に対してほぼ線形な実行時間と記憶領域を用いながら、高確率でε-最適戦略への収束を保証する。

ABSTRACT

In this paper, we settle the sampling complexity of solving discounted two-player turn-based zero-sum stochastic games up to polylogarithmic factors. Given a stochastic game with discount factor $γ\in(0,1)$ we provide an algorithm that computes an $ε$-optimal strategy with high-probability given $ ilde{O}((1 - γ)^{-3} ε^{-2})$ samples from the transition function for each state-action-pair. Our algorithm runs in time nearly linear in the number of samples and uses space nearly linear in the number of state-action pairs. As stochastic games generalize Markov decision processes (MDPs) our runtime and sample complexities are optimal due to Azar et al (2013). We achieve our results by showing how to generalize a near-optimal Q-learning based algorithms for MDP, in particular Sidford et al (2018), to two-player strategy computation algorithms. This overcomes limitations of standard Q-learning and strategy iteration or alternating minimization based approaches and we hope will pave the way for future reinforcement learning results by facilitating the extension of MDP results to multi-agent settings with little loss.

研究の動機と目的

  • 強化学習におけるマルコフ決定過程(MDP)と確率的ゲームの間のサンプル複雑度のギャップを埋めること。
  • MDPソルバーの最適なサンプル複雑度を、多項式対数因子の範囲で再現する2人確率的ゲーム用のアルゴリズムを開発すること。
  • 単一エージェントMDPにおける近似的に最適なQ学習アルゴリズムを、収束性と効率性を保証する多エージェント設定に一般化すること。
  • 標準的なQ学習や戦略反復の制限を克服し、2人ゲームにおける両側の単調性制約を強制することで、2人ゲームにおける性能を向上させること。
  • MDPベースの強化学習の結果を、最小限のオーバーヘッドで多エージェント環境に広く適用可能にする。

提案手法

  • アルゴリズムは、価値反復と戦略更新を組み合わせたQ学習の変種を用い、初期化と誤差制御を慎重に行い、価値および戦略の系列に単調性を維持する。
  • 2段階のサンプリングプロセスを導入する:初期に大きなバッチを用いて価値と分散を推定し、その後に小さなバッチで片側誤差境界を用いて価値推定を精緻化する。
  • 重要な要素として、値が $[0, (1-\gamma)^{-1}]$ の範囲に保たれるようにするクリッピングQ関数の更新を用いる。これにより安定性と単調性が保証される。
  • 片側誤差を保証するため、バイアス補正項 $\alpha_1^{3/4}\beta$ と信頼性に基づく調整 $C(1-\gamma)u$ を適用する。
  • 現在の価値推定と整合するように、$\boldsymbol{v}^{-(i)} \geq \boldsymbol{v}^{-(i-1)}$ および $\pi^{-(i)}$ を満たすように、単調増加価値戦略系列(MIVSS)を維持する。
  • アルゴリズムはサンプル数に対してほぼ線形な時間と空間計算量を達成し、ほぼ最適なサンプル複雑度を実現する。

実験結果

リサーチクエスチョン

  • RQ1割引付き確率的ゲームを解く際、MDPの既知の最良の境界と一致する近似的に最適なサンプル複雑度を達成できるか?
  • RQ2Q学習に基づく手法を2人確率的ゲームに一般化できるか、かつ収束性と単調性を保てるか?
  • RQ3戦略反復におけるMDPの解法回数を減らすことは可能か?$\Omega(1/(1-\gamma))$ の障壁を回避できるか?
  • RQ42人ゲームにおけるサンプリングの不確実性下でも、価値および戦略系列の両側の単調性を維持できるか?
  • RQ5MDPアルゴリズムの理論的保証を、サンプルまたは時間計算量の損失を最小限に抑えて多エージェント設定に拡張できるか?

主な発見

  • アルゴリズムは、高確率でε-最適戦略を計算するためのサンプル複雑度 $\tilde{O}((1-\gamma)^{-3}\epsilon^{-2})$ を達成する。
  • 実行時間はサンプル数に対してほぼ線形であり、記憶領域使用量は状態行動ペア数に対してほぼ線形である。
  • 本手法は、アザールら(2013年)が確立したMDPにおける最適なサンプル複雑度と一致し、多項式対数因子の範囲で一致する。
  • アルゴリズムは、シドフォードら(2018a年)が提唱した近似的に最適なQ学習フレームワークを2人確率的ゲームに成功裏に一般化する。
  • 両側の単調性の強制と分散に配慮したサンプリングにより、標準的な戦略反復や交互最小化の非効率性を回避する。
  • 理論的分析により、MDPと確率的ゲームの間のサンプリング複雑度のギャップは、正確な解法時間の計算の困難さにもかかわらず、閉じられることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。