Skip to main content
QUICK REVIEW

[论文解读] Near-Optimal Reinforcement Learning with Self-Play

Yu Bai, Chi Jin|arXiv (Cornell University)|Jun 22, 2020
Reinforcement Learning in Robotics参考文献 34被引用 14
一句话总结

本文提出了用于双人零和马尔可夫博弈的近似最优自对弈强化学习算法,引入了一种乐观纳什Q-learning变体和一种新型纳什V-learning算法。后者实现了样本复杂度 $ ilde{/mathcal{O}}(H^6 S(A+B)/ackslash epsilon^2)$,在 $ackslash mathrm{poly}(H)$ 因子范围内匹配信息论下界,从而填补了表格型马尔可夫博弈中长期存在的上下界差距。

ABSTRACT

This paper considers the problem of designing optimal algorithms for reinforcement learning in two-player zero-sum games. We focus on self-play algorithms which learn the optimal policy by playing against itself without any direct supervision. In a tabular episodic Markov game with $S$ states, $A$ max-player actions and $B$ min-player actions, the best existing algorithm for finding an approximate Nash equilibrium requires $ ilde{\mathcal{O}}(S^2AB)$ steps of game playing, when only highlighting the dependency on $(S,A,B)$. In contrast, the best existing lower bound scales as $Ω(S(A+B))$ and has a significant gap from the upper bound. This paper closes this gap for the first time: we propose an optimistic variant of the \emph{Nash Q-learning} algorithm with sample complexity $ ilde{\mathcal{O}}(SAB)$, and a new \emph{Nash V-learning} algorithm with sample complexity $ ilde{\mathcal{O}}(S(A+B))$. The latter result matches the information-theoretic lower bound in all problem-dependent parameters except for a polynomial factor of the length of each episode. In addition, we present a computational hardness result for learning the best responses against a fixed opponent in Markov games---a learning objective different from finding the Nash equilibrium.

研究动机与目标

  • 为双人表格型马尔可夫博弈中学习纳什均衡的样本复杂度,弥合最佳已知上界与信息论下界之间的差距。
  • 设计无需外部监督的自对弈算法,以学习最优策略,提升多智能体强化学习中的样本效率。
  • 建立在马尔可夫博弈中针对固定对手学习最优回应的计算困难性结果,表明其与学习带噪声的奇偶性问题等价。
  • 开发一种经过认证的策略提取技术,确保即使在策略基于近似值估计生成时,也能对最优回应保持性能鲁棒性。

提出的方法

  • 提出一种纳什Q-learning的乐观变体,通过维护Q值的上界和下界估计,并基于这些估计计算粗相关均衡(CCE)以执行策略。
  • 引入纳什V-learning,利用V值的乐观估计,并结合跟随正则化领导者(FTRL)与标准Q-learning来确定执行策略。
  • 采用一种新颖的FTRL分析方法,结合随时间变化的步长和置信区间,以控制遗憾并确保收敛至近似纳什均衡。
  • 利用浓度不等式和鞅论证,控制在不确定性下的值函数近似中的估计误差。
  • 应用联合界和有界鞅差序列,推导出策略和值估计的高概率置信区间。
  • 开发一种经过认证的策略提取方法,确保从值估计中提取的策略即使在对手采取最优回应时,也能保持接近纳什均衡的性能。

实验结果

研究问题

  • RQ1我们能否设计一种双人马尔可夫博弈的自对弈算法,其样本复杂度在 $ackslash mathrm{poly}(H)$ 因子范围内匹配信息论下界?
  • RQ2是否可能仅通过自对弈而无需外部监督,在马尔可夫博弈中实现近似最优的样本复杂度?
  • RQ3在马尔可夫博弈中,针对固定对手学习最优回应的计算复杂度是多少?它与已知困难问题有何关联?
  • RQ4我们能否从值估计中提取对最优回应攻击具有鲁棒性的策略,即使这些估计是近似的?

主要发现

  • 所提出的纳什V-learning算法实现了 $\tilde{\mathcal{O}}(H^6 S(A+B)/\epsilon^2)$ 的样本复杂度,在 $ackslash mathrm{poly}(H)$ 因子范围内匹配信息论下界。
  • 乐观纳什Q-learning变体实现了 $\tilde{\mathcal{O}}(H^5 SAB/\epsilon^2)$ 的样本复杂度,优于以往方法所需的 $\tilde{\mathcal{O}}(S^2AB)$ 步骤。
  • 在马尔可夫博弈中针对固定对手学习最优回应是计算困难的,其等价于学习带噪声的奇偶性问题,该问题被认为难以求解。
  • 该困难性结果意味着,个体玩家的无遗憾算法无法被有效用于在马尔可夫博弈中寻找纳什均衡。
  • 经过认证的策略提取技术确保了从值估计中提取的策略即使在对手采取最优回应时,也能保持接近最优的性能。
  • 本文填补了表格型马尔可夫博弈中 $S$、$A$ 和 $B$ 依赖关系上,最佳已知上界与信息论下界之间长期存在的差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。