Skip to main content
QUICK REVIEW

[论文解读] Sample-Efficient Reinforcement Learning of Partially Observable Markov Games

Qinghua Liu, Csaba Szepesvári|arXiv (Cornell University)|Jun 2, 2022
Reinforcement Learning in Robotics被引用 7
一句话总结

本文提出了 OMLE-Equilibrium 和 OMLE-Adversary 两种新算法,用于在弱揭示部分可观察马尔可夫博弈(POMGs)中实现样本高效的强化学习。通过结合乐观性与最大似然估计(MLE),这些方法在自对弈中找到均衡时实现了多项式样本复杂度,在对抗对手下实现了次线性遗憾,这是对一类丰富 POMGs 的首个可证明样本高效的成果。

ABSTRACT

This paper considers the challenging tasks of Multi-Agent Reinforcement Learning (MARL) under partial observability, where each agent only sees her own individual observations and actions that reveal incomplete information about the underlying state of system. This paper studies these tasks under the general model of multiplayer general-sum Partially Observable Markov Games (POMGs), which is significantly larger than the standard model of Imperfect Information Extensive-Form Games (IIEFGs). We identify a rich subclass of POMGs -- weakly revealing POMGs -- in which sample-efficient learning is tractable. In the self-play setting, we prove that a simple algorithm combining optimism and Maximum Likelihood Estimation (MLE) is sufficient to find approximate Nash equilibria, correlated equilibria, as well as coarse correlated equilibria of weakly revealing POMGs, in a polynomial number of samples when the number of agents is small. In the setting of playing against adversarial opponents, we show that a variant of our optimistic MLE algorithm is capable of achieving sublinear regret when being compared against the optimal maximin policies. To our best knowledge, this work provides the first line of sample-efficient results for learning POMGs.

研究动机与目标

  • 解决在部分可观察性下多智能体强化学习(MARL)的理论理解不足问题,其中智能体仅能观察局部信息。
  • 通过识别一个可处理的子类——弱揭示 POMGs——克服一般 POMGs 中学习的统计与计算不可行性。
  • 在观测与策略互动具有非马尔可夫性质的情况下,为自对弈与对抗设置中的均衡学习开发样本高效算法。
  • 为 POMGs 中的均衡寻找与遗憾最小化建立理论保证,超越以往针对受限模型(如 IIEFGs)的研究。

提出的方法

  • 提出一类新的 POMGs——弱揭示 POMGs——其中联合观测能揭示关于潜在状态的充分信息,从而实现高效学习。
  • 设计 OMLE-Equilibrium 算法,结合乐观性与 MLE,构建模型上的置信集,实现对近似纳什、相关与粗相关均衡的高效学习。
  • 采用放松的 MLE 方法,从轨迹中估计转移与观测模型,确保置信集随数据增加而缩小。
  • 在对抗设置中,将 OMLE-Equilibrium 改进为 OMLE-Adversary,该算法在置信集中计算最乐观的模型,并基于该模型下的最大最小值选择策略。
  • 利用对数似然差异抵消策略依赖性的事实,使学习者无需知晓对手策略即可构建置信集。
  • 证明置信集构造与联合策略无关,从而支持无需知晓对手策略的去中心化高效实现。

实验结果

研究问题

  • RQ1我们能否在超越受限模型(如 IIEFGs)的丰富部分可观察多智能体博弈类中实现样本高效学习?
  • RQ2能否设计出在弱揭示 POMGs 中通过自对弈寻找近似均衡且样本复杂度为多项式的时间算法?
  • RQ3在 POMGs 中,当学习者能访问其他玩家观测与动作的回放数据时,能否实现对抗对手下的次线性遗憾?
  • RQ4POMGs 的何种结构条件可支持在部分可观察性与策略互动下实现可证明高效的学>-习?
  • RQ5单步弱揭示 POMGs 的积极结果能否推广到多步设置?

主要发现

  • OMLE-Equilibrium 在自对弈下,对弱揭示 POMGs 中的近似纳什、相关与粗相关均衡,实现了多项式样本复杂度。
  • 当学习者能观察到游戏结束后其他玩家的观测与动作时,OMLE-Adversary 在对抗对手下实现 Õ(√k) 的遗憾边界,前提是满足假设 1。
  • 该遗憾边界对所有 k ∈ [K] 成立,高概率为 1−δ,且对系统参数(包括状态空间 S、动作空间 A、观测空间 O、时域 H 和精度 α)呈多项式依赖。
  • 置信集构造与联合策略无关,支持无需知晓对手策略的去中心化实现。
  • 一个负面结果表明,即使拥有完整的回放数据,也无法将次线性遗憾保证推广到多步弱揭示 POMGs,一般情况下不可能。
  • 本工作首次为一类广泛 POMGs 的学习提供了可证明的样本高效结果,显著拓展了以往针对 IIEFGs 和 POMDPs 的理论工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。