Skip to main content
QUICK REVIEW

[论文解读] Almost Optimal Algorithms for Two-player Markov Games with Linear Function Approximation.

Zixiang Chen, Dongruo Zhou|arXiv (Cornell University)|Feb 15, 2021
Reinforcement Learning in Robotics参考文献 49被引用 4
一句话总结

本文提出Nash-UCRL-VTR,一种用于具有线性函数近似的双人零和马尔可夫博弈的乐观强化学习算法。该算法实现了$˜{O}(dH\sqrt{T})$的遗憾边界,与相应的下界一致,证明了在具有线性转移模型的纳什均衡学习中遗憾的近似最优性。

ABSTRACT

We study reinforcement learning for two-player zero-sum Markov games with simultaneous moves in the finite-horizon setting, where the transition kernel of the underlying Markov games can be parameterized by a linear function over the current state, both players' actions and the next state. In particular, we assume that we can control both players and aim to find the Nash Equilibrium by minimizing the duality gap. We propose an algorithm Nash-UCRL-VTR based on the principle Optimism-in-Face-of-Uncertainty. Our algorithm only needs to find a Coarse Correlated Equilibrium (CCE), which is computationally very efficient. Specifically, we show that Nash-UCRL-VTR can provably achieve an $ ilde{O}(dH\sqrt{T})$ regret, where $d$ is the linear function dimension, $H$ is the length of the game and $T$ is the total number of steps in the game. To access the optimality of our algorithm, we also prove an $ ilde{\Omega}( dH\sqrt{T})$ lower bound on the regret. Our upper bound matches the lower bound up to logarithmic factors, which suggests the optimality of our algorithm.

研究动机与目标

  • 开发一种可证明高效的算法,用于在具有同时行动的双人零和马尔可夫博弈中学习纳什均衡。
  • 处理转移核在状态、双方动作和下一状态上线性参数化的环境。
  • 通过在不确定性面前采用乐观策略来最小化对偶间隙。
  • 通过仅依赖粗相关均衡计算来确保计算效率。
  • 建立紧致的遗憾边界,使其与信息论下界在对数因子范围内一致。

提出的方法

  • 该算法采用面对不确定性时的乐观原则(OFU)来平衡探索与利用。
  • 它使用线性函数近似,将转移核建模为状态、双方动作和下一状态的线性函数。
  • 该方法在每个阶段计算一个粗相关均衡(CCE),其计算效率高,且足以实现向纳什均衡的收敛。
  • 它维护对值函数估计的置信区间,以指导探索。
  • 该算法基于乐观的值函数估计来更新策略,以最小化遗憾。
  • 遗憾分析依赖于方差感知的集中不等式,以及对偶间隙的一种新颖分解。

实验结果

研究问题

  • RQ1我们能否为具有线性函数近似的双人马尔可夫博弈设计一种可证明高效的算法?
  • RQ2在具有线性转移模型的此类博弈中,可实现的最优遗憾是多少?
  • RQ3该算法能否在保持计算可处理性的同时实现遗憾的近似最优性?
  • RQ4与完整纳什均衡计算相比,使用粗相关均衡在效率和性能方面有何差异?
  • RQ5在此设置下,遗憾的信息论下界是什么?

主要发现

  • 所提出的算法Nash-UCRL-VTR实现了$˜{O}(dH\sqrt{T})$的遗憾边界,其中$d$为线性函数维度,$H$为时域,$T$为总步数。
  • 遗憾边界与相应的$˜{\Omega}(dH\sqrt{T})$下界一致,表明在对数因子范围内达到近似最优性。
  • 该算法仅需在每一步计算一个粗相关均衡,从而确保计算效率。
  • 在不确定性面前采用乐观策略,可实现有效探索,而无需显式计算纳什均衡。
  • 理论分析在具有同时行动的双人零和马尔可夫博弈中,基于线性函数近似建立了紧致的遗憾边界。
  • 结果表明,该算法在遗憾尺度上是最优的,仅在对数因子范围内存在差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。