Skip to main content
QUICK REVIEW

[论文解读] Solving Discounted Stochastic Two-Player Games with Near-Optimal Time and Sample Complexity

Aaron Sidford, Mengdi Wang|arXiv (Cornell University)|Aug 29, 2019
Reinforcement Learning in Robotics参考文献 38被引用 17
一句话总结

本文提出了一种新颖的算法,用于求解折扣随机双人零和博弈,其样本复杂度和时间复杂度接近最优,达到 $\tilde{O}((1-\gamma)^{-3}\epsilon^{-2})$ 个样本——与已知最优的马尔可夫决策过程(MDP)边界一致。通过将Q-learning推广为保持单调性的更新方式并引入方差减少机制,该方法确保以高概率收敛至 $\epsilon$-最优策略,且运行时间和空间复杂度在样本数量上近乎线性。

ABSTRACT

In this paper, we settle the sampling complexity of solving discounted two-player turn-based zero-sum stochastic games up to polylogarithmic factors. Given a stochastic game with discount factor $γ\in(0,1)$ we provide an algorithm that computes an $ε$-optimal strategy with high-probability given $ ilde{O}((1 - γ)^{-3} ε^{-2})$ samples from the transition function for each state-action-pair. Our algorithm runs in time nearly linear in the number of samples and uses space nearly linear in the number of state-action pairs. As stochastic games generalize Markov decision processes (MDPs) our runtime and sample complexities are optimal due to Azar et al (2013). We achieve our results by showing how to generalize a near-optimal Q-learning based algorithms for MDP, in particular Sidford et al (2018), to two-player strategy computation algorithms. This overcomes limitations of standard Q-learning and strategy iteration or alternating minimization based approaches and we hope will pave the way for future reinforcement learning results by facilitating the extension of MDP results to multi-agent settings with little loss.

研究动机与目标

  • 弥合强化学习中求解马尔可夫决策过程(MDP)与随机博弈之间在样本复杂度上的差距。
  • 开发一种适用于双人随机博弈的算法,其样本复杂度与MDP求解器的最优边界一致,仅相差对数因子。
  • 将单智能体MDP中近似最优的Q-learning算法推广至多智能体设置,并保证收敛性和效率。
  • 通过施加双向单调性约束,克服标准Q-learning和策略迭代在双人博弈中的局限性。
  • 使基于MDP的强化学习结果能够以最小开销扩展至多智能体环境。

提出的方法

  • 该算法采用一种结合值迭代与策略更新的Q-learning变体,通过仔细的初始化和误差控制,保持值序列与策略序列的单调性。
  • 引入两阶段采样过程:首先使用大规模批量估计值和方差,随后使用较小批量对值估计进行精炼,并施加单边误差边界。
  • 关键组件是使用截断Q函数更新,确保值始终位于 $[0, (1-\gamma)^{-1}]$ 范围内,从而保持稳定性和单调性。
  • 通过引入偏差校正项 $\alpha_1^{3/4}\beta$ 和基于置信度的调整项 $C(1-\gamma)u$,确保值估计具有单边误差。
  • 通过强制满足 $\boldsymbol{v}^{-(i)} \geq \boldsymbol{v}^{-(i-1)}$ 且 $\pi^{-(i)}$ 与当前值估计一致,维护单调递增的值-策略序列(MIVSS)。
  • 该算法在样本数量上实现近乎线性的运行时间与空间复杂度,达到近乎最优的样本复杂度。

实验结果

研究问题

  • RQ1我们能否在求解折扣随机博弈时实现接近最优的样本复杂度,与MDP的最佳已知边界一致?
  • RQ2基于Q-learning的方法能否推广至双人随机博弈,同时保持收敛性和单调性?
  • RQ3是否能够减少策略迭代在随机博弈中所需的MDP求解次数,从而避免 $\Omega(1/(1-\gamma))$ 的障碍?
  • RQ4在双人博弈中,面对采样不确定性,能否在值序列与策略序列上维持双向单调性?
  • RQ5MDP算法的理论保证能否被扩展至多智能体设置,且样本或时间复杂度损失最小?

主要发现

  • 该算法在以高概率计算出 $\epsilon$-最优策略时,实现了 $\tilde{O}((1-\gamma)^{-3}\epsilon^{-2})$ 的样本复杂度。
  • 运行时间在样本数量上近乎线性,空间使用量在状态-动作对数量上也近乎线性。
  • 该方法匹配了MDP中已知的最优样本复杂度,如Azar等人(2013)所建立的边界,仅相差对数因子。
  • 该算法成功将Sidford等人(2018a)提出的近似最优Q-learning框架推广至双人随机博弈。
  • 通过强制实施双向单调性并采用方差感知采样,该方法避免了标准策略迭代或交替最小化方法的低效性。
  • 理论分析证实,尽管在精确解时间上存在计算难度差距,但MDP与随机博弈之间的采样复杂度差距可以被消除。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。