Skip to main content
QUICK REVIEW

[論文レビュー] Provably Efficient Online Agnostic Learning in Markov Games.

Yi Tian, Yuanhao Wang|arXiv (Cornell University)|Oct 28, 2020
Reinforcement Learning in Robotics参考文献 22被引用数 5
ひとこと要約

本稿では、観測不能な相手の行動を伴うマルコフゲームにおける、最初の証明可能に効率的なオンラインアグノスティック学習アルゴリズムを提示し、K回のエピソード後におけるサブ線形なリグレットバウンド $ ilde{ackepsilon}(K^{3/4})$ を達成した。この手法は相手の行動空間のサイズに依存せず、行動が観測可能であっても、先行研究に比べて指数的要因の改善を達成する。

ABSTRACT

We study online agnostic learning, a problem that arises in episodic multi-agent reinforcement learning where the actions of the opponents are unobservable. We show that in this challenging setting, achieving sublinear regret against the best response in hindsight is statistically hard. We then consider a weaker notion of regret, and present an algorithm that achieves after $K$ episodes a sublinear $ ilde{\mathcal{O}}(K^{3/4})$ regret. This is the first sublinear regret bound (to our knowledge) in the online agnostic setting. Importantly, our regret bound is independent of the size of the opponents' action spaces. As a result, even when the opponents' actions are fully observable, our regret bound improves upon existing analysis (e.g., (Xie et al., 2020)) by an exponential factor in the number of opponents.

研究の動機と目的

  • 相手の行動が観測不能であるエピソード型マルチエージェント強化学習におけるオンラインアグノスティック学習の課題に対処すること。
  • 観測不能な相手の行動下で、後悔の最適応答に対するサブ線形リグレットを達成する統計的難易度を分析すること。
  • オンラインアグノスティック設定で証明可能にサブ線形リグレットを達成できるようにする、より弱いリグレットの概念を提案すること。
  • 相手の行動空間のサイズに依存しないリグレットを持つアルゴリズムを設計し、スケーラビリティを向上させること。
  • 特に相手の行動が観測可能である場合に、先行研究よりも改善されたリグレットバウンドを達成すること。

提案手法

  • 後悔の最適応答に対するサブ線形リグレットを達成する統計的難易度を回避するため、より弱いリグレットの概念を導入すること。
  • 新規の分析フレームワークを活用し、K回のエピソード後における $ ilde{ackepsilon}(K^{3/4})$ のリグレットを達成するアルゴリズムを設計すること。
  • 構造化された探索と推定メカニズムを通じて、リグレットバウンドを相手の行動空間のサイズから分離すること。
  • 相手の行動が部分的に観測可能なマルコフゲームに適応したオンライン学習技術を用いること。
  • 集中不等式とリグレット分解を適用して、最終的なバウンドを導出すること。
  • リグレットバウンドがサブ線形であり、かつ相手の数やその行動集合のサイズに依存しないことを保証すること。

実験結果

リサーチクエスチョン

  • RQ1観測不能な相手の行動を伴うオンラインアグノスティック学習において、後悔の最適応答に対するサブ線形リグレットは達成可能か?
  • RQ2より弱いリグレットの概念は、この設定で証明可能にサブ線形リグレットを達成可能か?
  • RQ3リグレットバウンドを相手の行動空間のサイズに依存させない形にできるか?
  • RQ4相手の行動が観測可能である場合に、提案されたアルゴリズムのリグレットは、既存の手法と比較してどのように異なるか?
  • RQ5マルコフゲームにおけるオンラインアグノスティック学習設定で、達成可能な最適なリグレットバウンドは何か?

主な発見

  • 本稿では、観測不能な相手の行動を伴うオンラインアグノスティック設定において、後悔の最適応答に対するサブ線形リグレットを達成することは統計的に困難であることを確立した。
  • 提案されたアルゴリズムは、K回のエピソード後におけるサブ線形リグレットバウンド $ ilde{ackepsilon}(K^{3/4})$ を達成し、この設定で初めての結果である。
  • リグレットバウンドは相手の行動空間のサイズに依存せず、大規模または未知の行動集合へのスケーラビリティを可能にする。
  • 相手の行動が観測可能であっても、リグレットバウンドは先行研究(例:Xieら、2020年)に比べて、相手の数の指数的要因で改善されている。
  • 部分的観測下におけるマルコフゲームにおけるオンラインアグノスティック学習の証明可能に効率的な解決策を提供する。
  • 分析により、より弱いリグレットの概念が、行動空間のサイズに依存しないままサブ線形リグレットを達成するのに十分であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。