Skip to main content
QUICK REVIEW

[论文解读] Online Reinforcement Learning in Stochastic Games

Chen-Yu Wei, Yi-Te Hong|arXiv (Cornell University)|Dec 2, 2017
Advanced Bandit Algorithms Research参考文献 10被引用 7
一句话总结

本文提出UCSG算法,用于平均奖励随机博弈中的在线强化学习,在面对任意对手时通过利用乐观性并以一种新颖方式将对手的非平稳策略替换为平稳策略,实现了次线性遗憾。主要贡献是首次在无折扣、非周期性设置下,为寻找ε-最大最小平稳策略提供了Õ(DS²A/ε³)的样本复杂度界,优于先前工作。

ABSTRACT

We study online reinforcement learning in average-reward stochastic games (SGs). An SG models a two-player zero-sum game in a Markov environment, where state transitions and one-step payoffs are determined simultaneously by a learner and an adversary. We propose the UCSG algorithm that achieves a sublinear regret compared to the game value when competing with an arbitrary opponent. This result improves previous ones under the same setting. The regret bound has a dependency on the diameter, which is an intrinsic value related to the mixing property of SGs. If we let the opponent play an optimistic best response to the learner, UCSG finds an $\varepsilon$-maximin stationary policy with a sample complexity of $ ilde{\mathcal{O}}\left( ext{poly}(1/\varepsilon) ight)$, where $\varepsilon$ is the gap to the best policy.

研究动机与目标

  • 解决在平均奖励、非周期性设置下的双人零和随机博弈中的在线强化学习问题。
  • 开发一种算法,使在面对任意对手时与博弈值相比实现次线性遗憾。
  • 在平均奖励设置下,为寻找ε-最大最小平稳策略提供Õ(poly(1/ε))的样本复杂度界。
  • 克服在遗憾分析中由对手非平稳性和不可控性带来的挑战,这些挑战使得基于MDP的扰动技术失效。

提出的方法

  • 提出UCSG算法,通过在不确定性面前保持乐观,实现探索与利用的平衡,且无需手动调参。
  • 引入一种新颖的分析技术,将对手的非平稳策略替换为平稳策略,从而支持基于扰动的分析。
  • 采用约束优化方法,在基于直径的界下选择乐观模型,确保真实模型保持可行。
  • 使用集中不等式和状态动作值函数分解,对各轮次的遗憾项进行有界。
  • 将遗憾进行分层分解为六个组成部分,其中主要项通过引理I.1和定理K.1进行分析。
  • 利用直径D作为关键结构参数,以控制混合时间并调节遗憾增长。

实验结果

研究问题

  • RQ1在面对任意对手时,是否可以在平均奖励随机博弈的在线强化学习中实现次线性遗憾?
  • RQ2在无折扣、非周期性设置下,学习ε-最大最小平稳策略的最优样本复杂度是多少?
  • RQ3如何在理论上处理非平稳对手行为,以将基于MDP的遗憾分析扩展到随机博弈?
  • RQ4是否可以将遗憾界改进为仅依赖于直径D等结构参数,而非折扣因子?
  • RQ5是否可能在学习过程的任意阶段输出当前最优的平稳策略,而非仅在固定时域规划后?

主要发现

  • UCSG算法在平均奖励随机博弈中,为寻找ε-最大最小平稳策略实现了Õ(DS²A/ε³)的遗憾界。
  • 遗憾在步数上为次线性,主要项由直径D以及状态-动作空间大小S和A决定。
  • 实现ε-最优性的样本复杂度为Õ(DS²A/ε³),这是在平均奖励、非周期性设置下的首次此类界。
  • 该算法可在学习过程的任意时刻输出当前最优的平稳策略,而不同于以往方法仅在固定时域规划后输出。
  • 通过将对手的非平稳策略替换为平稳策略的方法,使基于扰动的分析成为可能,从而克服了MARL中的一个关键挑战。
  • 该界与折扣因子无关,因此适用于折扣模型不充分的长时程规划任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。