Skip to main content
QUICK REVIEW

[論文レビュー] Near-Optimal Reinforcement Learning with Self-Play

Yu Bai, Chi Jin|arXiv (Cornell University)|Jun 22, 2020
Reinforcement Learning in Robotics参考文献 34被引用数 14
ひとこと要約

本稿は、2人零和マルコフゲームにおける近似的最適な自己対戦強化学習アルゴリズムを提案し、オプティミスティックなネッシュQ学習の変種と、新規のネッシュV学習アルゴリズムを導入する。後者は、$ ilde{/mathcal{O}}(H^6 S(A+B)/ackslash epsilon^2)$ のサンプル複雑度を達成し、情報理論的下界に対して $ackslash mathrm{poly}(H)$ 要因の差異を除き一致しており、表形式マルコフゲームにおけるサンプル複雑度の上界と下界の間の長年のギャップを埋めることに成功した。

ABSTRACT

This paper considers the problem of designing optimal algorithms for reinforcement learning in two-player zero-sum games. We focus on self-play algorithms which learn the optimal policy by playing against itself without any direct supervision. In a tabular episodic Markov game with $S$ states, $A$ max-player actions and $B$ min-player actions, the best existing algorithm for finding an approximate Nash equilibrium requires $ ilde{\mathcal{O}}(S^2AB)$ steps of game playing, when only highlighting the dependency on $(S,A,B)$. In contrast, the best existing lower bound scales as $Ω(S(A+B))$ and has a significant gap from the upper bound. This paper closes this gap for the first time: we propose an optimistic variant of the \emph{Nash Q-learning} algorithm with sample complexity $ ilde{\mathcal{O}}(SAB)$, and a new \emph{Nash V-learning} algorithm with sample complexity $ ilde{\mathcal{O}}(S(A+B))$. The latter result matches the information-theoretic lower bound in all problem-dependent parameters except for a polynomial factor of the length of each episode. In addition, we present a computational hardness result for learning the best responses against a fixed opponent in Markov games---a learning objective different from finding the Nash equilibrium.

研究の動機と目的

  • 2人表形式マルコフゲームにおけるネッシュ均衡を学習するための、既存の最良の上界と情報理論的下界との間のサンプル複雑度のギャップを埋めること。
  • 自己対戦アルゴリズムを設計し、外部監督なしに最適な方策を学習することで、マルチエージェント強化学習におけるサンプル効率を向上させること。
  • 固定相手に対する最良の反応を学習する際の計算の難易度を特定し、それがノイズ付きパリティ学習問題と同等であることを示すこと。
  • 近似的な価値推定から得られる方策に対しても、最良の反応に対して頑健な性能を保証する、検証可能な方策抽出技術を開発すること。

提案手法

  • Q値の上界と下界の推定を維持し、それらの推定値の上での粗い相関均衡(CCE)を計算することで方策を実行する、ネッシュQ学習のオプティミスティックな変種を提案する。
  • ネッシュV学習を導入し、V値のオプティミスティック推定を用い、FTRL(フォローザラーレギュライズドリーダー)と標準的なQ学習を組み合わせて実行方策を決定する。
  • 時間依存のステップサイズと信頼区間を用いた新規なFTRL解析を用い、レジーロスを抑え、近似的なネッシュ均衡への収束を保証する。
  • 集中不等式とマルティングルールの議論を用いて、不確実性下での価値関数近似における推定誤差を制御する。
  • 和集合の不等式と有界なマルティングルール差分列を用いて、方策および価値推定の高確率的信頼区間を導出する。
  • 近似的な推定値から得られる方策が相手の最良の反応に対しても近似的に最適な性能を保証する、検証可能な方策抽出手法を開発する。

実験結果

リサーチクエスチョン

  • RQ12人マルコフゲームにおける自己対戦アルゴリズムを設計できるか。そのサンプル複雑度は、情報理論的下界に対して $ackslash mathrm{poly}(H)$ 要因の差異を除き一致するか。
  • RQ2外部監督なしに自己対戦のみを用いて、マルコフゲームで近的最適なサンプル複雑度を達成できるか。
  • RQ3固定相手に対する最良の反応を学習する際の計算複雑度は何か。また、既知の難問とどのように関係するか。
  • RQ4近似的な推定値から得られる方策を、最良の反応攻撃に対しても頑健に保証できるか。

主な発見

  • 提案されたネッシュV学習アルゴリズムは、$\tilde{\mathcal{O}}(H^6 S(A+B)/\epsilon^2)$ のサンプル複雑度を達成し、情報理論的下界に対して $ackslash mathrm{poly}(H)$ 要因の差異を除き一致する。
  • オプティミスティックなネッシュQ学習の変種は、$\tilde{\mathcal{O}}(H^5 SAB/\epsilon^2)$ のサンプル複雑度を達成し、従来の方法が要求する $\tilde{\mathcal{O}}(S^2AB)$ ステップを改善する。
  • 固定相手に対する最良の反応を学習することは計算的に困難であり、ノイズ付きパリティ学習問題と同等である。この問題は、計算的に困難であると広く信じられている。
  • この難易度の結果は、個々のプレイヤーのノーレジーロスアルゴリズムが、マルコフゲームにおけるネッシュ均衡を効率的に見つけるためには使用できないことを示唆する。
  • 検証可能な方策抽出手法により、相手が最良の反応を取る状況でも、価値推定から得られる方策がネッシュ均衡方策に近い性能を維持することが保証される。
  • 本稿は、表形式マルコフゲームにおける $S$、$A$、$B$ の依存関係に関して、長年の上界と情報理論的下界のギャップを解消した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。