Skip to main content
QUICK REVIEW

[論文レビュー] Online Reinforcement Learning in Stochastic Games

Chen-Yu Wei, Yi-Te Hong|arXiv (Cornell University)|Dec 2, 2017
Advanced Bandit Algorithms Research参考文献 10被引用数 7
ひとこと要約

本稿では、平均報酬の確率的ゲームにおけるオンライン強化学習のためのUCSGアルゴリズムを提案する。非定常的で任意の相手に対して、楽観主義と相手の非定常的方策を定常的ものに置き換える新しい手法を用いることで、サブ線形なレグレットを達成する。主な貢献は、ε-最大最小定常方策を求めるためのサンプル複雑度の上限が Õ(DS²A/ε³) であることを示したことであり、割引率なしでエピソードに依存しない設定において、先行研究を改善する。

ABSTRACT

We study online reinforcement learning in average-reward stochastic games (SGs). An SG models a two-player zero-sum game in a Markov environment, where state transitions and one-step payoffs are determined simultaneously by a learner and an adversary. We propose the UCSG algorithm that achieves a sublinear regret compared to the game value when competing with an arbitrary opponent. This result improves previous ones under the same setting. The regret bound has a dependency on the diameter, which is an intrinsic value related to the mixing property of SGs. If we let the opponent play an optimistic best response to the learner, UCSG finds an $\varepsilon$-maximin stationary policy with a sample complexity of $ ilde{\mathcal{O}}\left( ext{poly}(1/\varepsilon) ight)$, where $\varepsilon$ is the gap to the best policy.

研究の動機と目的

  • 平均報酬、エピソードに依存しない設定における2人零和確率的ゲームにおけるオンライン強化学習に対処すること。
  • 任意の相手に対してゲーム価値と比較してサブ線形なレグレットを達成するアルゴリズムを開発すること。
  • 平均報酬設定において、ε-最大最小定常方策を求めるためのサンプル複雑度の上限を Õ(poly(1/ε)) として提供すること。
  • 相手の非定常性と制御不能性によるレグレット解析上の課題に直面し、標準的なMDPベースの摂動技術が無効になることを克服すること。

提案手法

  • 不確実性に対する楽観主義を用いて、手動によるハイパーパrameterチューニングなしに探索と活用のバランスを図るUCSGアルゴリズムを提案する。
  • 相手の非定常的方策を定常的ものに置き換えるための新しい解析的手法を導入し、摂動に基づく解析を可能にする。
  • 直径に基づく境界を用いて、楽観的なモデルを選択する制約付き最適化アプローチを採用し、真のモデルが妥当な範囲内に保たれることを保証する。
  • 集中不等式と状態-行動価値関数の分解を用いて、エピソード間でのレグレット項を制限する。
  • レグレットを6つの成分に階層的に分解し、主要な項は補題I.1および定理K.1を用いて解析する。
  • 混合時間の制御とレグレット成長の調節のため、直径Dを主要な構造的パラメータとして活用する。

実験結果

リサーチクエスチョン

  • RQ1任意の相手に対して、平均報酬の確率的ゲームにおけるオンライン強化学習でサブ線形なレグレットを達成できるか?
  • RQ2割引率なしでエピソードに依存しない設定において、ε-最大最小定常方策を学習するための最適なサンプル複雑度は何か?
  • RQ3非定常的相手行動を解析的に扱うにはどうすればよいか?これにより、MDPベースのレグレット解析を確率的ゲームに拡張できるか?
  • RQ4レグレット境界を割引率ではなく、直径Dのような構造的パラメータに依存させるのは可能か?
  • RQ5固定ホライズン計画の後ではなく、学習の任意の段階で現在の最良の定常方策を出力することは可能か?

主な発見

  • UCSGアルゴリズムは、平均報酬の確率的ゲームにおいて、ε-最大最小定常方策を求めるためのレグレット境界 Õ(DS²A/ε³) を達成する。
  • レグレットはステップ数に対してサブ線形であり、主要な項は直径Dと状態・行動空間のサイズSとAに起因する。
  • ε-最適性を達成するためのサンプル複雑度は Õ(DS²A/ε³) であり、これは平均報酬でエピソードに依存しない設定において初めての境界である。
  • 本アルゴリズムは、学習の任意の段階で現在の最良の定常方策を出力するが、従来の手法は固定ホライズン計画の後でのみ出力可能である。
  • 相手の非定常的方策を定常的ものに置き換える手法により、摂動解析が可能になり、マルチエージェント強化学習における主要な課題を克服できる。
  • 境界は割引率に依存しないため、割引モデルが不適切な長時間ホライズン計画タスクに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。