[论文解读] The Advantage Regret-Matching Actor-Critic
本文提出了一种无模型强化学习算法——优势后悔匹配演员-评论家(ARMAC),该算法通过存储过去的策略并利用离策略评论家事后估计条件优势,实现无需重要性采样即可进行后悔最小化策略更新。ARMAC在无限注德州扑克中实现了低可被利用性,击败了LBR-FCPA,并在基准游戏中优于MC-RCFR和NFSP。
Regret minimization has played a key role in online learning, equilibrium computation in games, and reinforcement learning (RL). In this paper, we describe a general model-free RL method for no-regret learning based on repeated reconsideration of past behavior. We propose a model-free RL algorithm, the AdvantageRegret-Matching Actor-Critic (ARMAC): rather than saving past state-action data, ARMAC saves a buffer of past policies, replaying through them to reconstruct hindsight assessments of past behavior. These retrospective value estimates are used to predict conditional advantages which, combined with regret matching, produces a new policy. In particular, ARMAC learns from sampled trajectories in a centralized training setting, without requiring the application of importance sampling commonly used in Monte Carlo counterfactual regret (CFR) minimization; hence, it does not suffer from excessive variance in large environments. In the single-agent setting, ARMAC shows an interesting form of exploration by keeping past policies intact. In the multiagent setting, ARMAC in self-play approaches Nash equilibria on some partially-observable zero-sum benchmarks. We provide exploitability estimates in the significantly larger game of betting-abstracted no-limit Texas Hold'em.
研究动机与目标
- 开发一种可扩展的无模型强化学习算法,通过函数逼近将后悔最小化推广至大规模状态空间。
- 通过避免重要性采样,解决大型环境中蒙特卡洛反事实后悔最小化(CFR)的高方差问题。
- 通过使用存储的过去策略进行事后策略改进,在非平稳多智能体环境中实现稳定学习。
- 证明ARMAC能够在复杂游戏(如无限注德州扑克)中收敛至低可被利用性策略,而无需计算最佳响应或使用专家特征。
提出的方法
- ARMAC维护一个过去策略的缓冲区,并重放这些策略以重构过去行为的回溯性评估。
- 它使用离策略评论家来估计条件优势 $ W_i(s,a) $,该值由状态相关因子 $ B(s) $ 缩放的反事实后悔 $ R_i(s,a) $ 得到。
- 该算法在估计的条件优势上应用后悔匹配,生成新策略,其行为类似于CFR但无需完整后悔累积。
- 它利用标准策略评估技术在采样轨迹上训练评论家,实现在集中式、无模型设置下的端到端训练。
- 该方法通过使用过去策略的价值估计避免了重要性采样,降低了大型环境中的方差。
- 在多智能体设置中,ARMAC使用自对弈与策略重放,以在部分可观测零和游戏中逼近纳什均衡。
实验结果
研究问题
- RQ1无模型强化学习算法是否能在不依赖重要性采样的情况下,实现在大规模序列决策问题中的无后悔学习?
- RQ2使用存储的过去策略和价值估计进行事后策略改进,是否能导致复杂游戏中稳定且低可被利用性的策略?
- RQ3ARMAC与NFSP、MC-RCFR和Deep CFR等现有方法相比,在可被利用性和收敛速度方面表现如何?
- RQ4ARMAC是否能够在无需前向模型或专家特征的情况下扩展至大规模游戏(如无限注德州扑克)?
主要发现
- 在无限注德州扑克中,ARMAC对LBR-FCPA的平均胜率达到了 519 ± 81 枚筹码/局,表明其未被该强基线所利用。
- 仅经过1小时训练(300万次动作步数),ARMAC便以 561 ± 163 枚筹码/局的胜率击败LBR-FC12-FCPA34,显示出快速的策略改进能力。
- 在训练18天后,ARMAC被LBR-FC(仅使用弃牌和跟注)所利用,每局损失 -46 ± 26 枚筹码,表明其在处理高度受限动作集时存在局限性。
- 在基准游戏中,ARMAC的NashConv值低于MC-RCFR,且与NFSP相比达到相当或更优的结果,表明其具有强大的均衡收敛能力。
- 该算法通过保留过去策略展现出一种独特的探索形式,这有助于在单智能体设置中实现稳定学习。
- ARMAC在无限注德州扑克中实现了可被利用性的边界,据作者所知,这是该类算法中首次报告的相关结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。