Skip to main content
QUICK REVIEW

[论文解读] Provably Efficient Online Agnostic Learning in Markov Games.

Yi Tian, Yuanhao Wang|arXiv (Cornell University)|Oct 28, 2020
Reinforcement Learning in Robotics参考文献 22被引用 5
一句话总结

本文提出了首个针对对手动作不可观测的马尔可夫博弈的可证明高效的在线agnostic学习算法,在K轮后实现了$ ilde{/mathcal{O}}(K^{3/4})$的次线性遗憾。该方法与对手动作空间大小无关,即使在动作可观测时,相比之前的工作也实现了指数级的改进。

ABSTRACT

We study online agnostic learning, a problem that arises in episodic multi-agent reinforcement learning where the actions of the opponents are unobservable. We show that in this challenging setting, achieving sublinear regret against the best response in hindsight is statistically hard. We then consider a weaker notion of regret, and present an algorithm that achieves after $K$ episodes a sublinear $ ilde{\mathcal{O}}(K^{3/4})$ regret. This is the first sublinear regret bound (to our knowledge) in the online agnostic setting. Importantly, our regret bound is independent of the size of the opponents' action spaces. As a result, even when the opponents' actions are fully observable, our regret bound improves upon existing analysis (e.g., (Xie et al., 2020)) by an exponential factor in the number of opponents.

研究动机与目标

  • 解决在对手动作不可观测的场景下,回合式多智能体强化学习中的在线agnostic学习挑战。
  • 分析在对手行为不可观测条件下,实现对事后最优响应的次线性遗憾的统计难度。
  • 提出一种更弱的遗憾定义,以在在线agnostic设置中实现可证明的次线性遗憾。
  • 设计一种遗憾与对手动作空间大小无关的算法,提升可扩展性。
  • 与之前工作相比,实现更优的遗憾界,尤其在对手动作可观测时表现更优。

提出的方法

  • 引入一种更弱的遗憾定义,以规避在对手动作不可观测的在线agnostic设置中实现对事后最优响应的次线性遗憾的统计困难。
  • 设计一种在K轮后实现$ ilde{/mathcal{O}}(K^{3/4})$遗憾的算法,借助一种新颖的分析框架。
  • 通过结构化的探索与估计机制,将遗憾界与对手动作空间大小解耦。
  • 使用适用于对手动作部分可观测的马尔可夫博弈的在线学习技术。
  • 应用集中不等式与遗憾分解技术,推导出最终的遗憾界。
  • 确保遗憾界保持次线性,并且与对手数量或其动作集大小无关。

实验结果

研究问题

  • RQ1在对手动作不可观测的在线agnostic学习设置中,能否实现对事后最优响应的次线性遗憾?
  • RQ2更弱的遗憾定义是否能在该设置中实现可证明的次线性遗憾?
  • RQ3能否使遗憾界独立于对手动作空间的大小?
  • RQ4当对手动作可观测时,所提算法的遗憾与现有方法相比如何?
  • RQ5在马尔可夫博弈的在线agnostic学习设置中,可实现的最优遗憾界是什么?

主要发现

  • 本文证明,在对手动作不可观测的在线agnostic学习设置中,实现对事后最优响应的次线性遗憾在统计上是困难的。
  • 所提算法在K轮后实现了$ ilde{/mathcal{O}}(K^{3/4})$的次线性遗憾界,这是该设置下的首个此类结果。
  • 遗憾界与对手动作空间大小无关,从而可扩展至大规模或未知的动作集合。
  • 即使对手动作可观测,该遗憾界相比之前工作(如Xie等,2020)在对手数量上实现了指数级改进。
  • 该方法为在部分可观测条件下实现马尔可夫博弈的在线agnostic学习提供了可证明高效的解决方案。
  • 分析表明,采用更弱的遗憾定义足以实现次线性遗憾,同时保持与动作空间大小的独立性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。