[论文解读] Off-Policy Actor-Critic with Shared Experience Replay
本文提出 LASER,一种使用共享大规模经验回放的离策略演员-评论家强化学习智能体,实现了最先进的数据效率。通过混合在线策略经验与回放经验,并采用信任区域方案,LASER 在强离策略设置下实现了稳定且高样本效率的学习,在 200M 环境步数内于 57 个 Atari 游戏上达到 448% 的人类标准化得分。
We investigate the combination of actor-critic reinforcement learning algorithms with uniform large-scale experience replay and propose solutions for two challenges: (a) efficient actor-critic learning with experience replay (b) stability of off-policy learning where agents learn from other agents behaviour. We employ those insights to accelerate hyper-parameter sweeps in which all participating agents run concurrently and share their experience via a common replay module. To this end we analyze the bias-variance tradeoffs in V-trace, a form of importance sampling for actor-critic methods. Based on our analysis, we then argue for mixing experience sampled from replay with on-policy experience, and propose a new trust region scheme that scales effectively to data distributions where V-trace becomes unstable. We provide extensive empirical validation of the proposed solution. We further show the benefits of this setup by demonstrating state-of-the-art data efficiency on Atari among agents trained up until 200M environment frames.
研究动机与目标
- 解决使用经验回放时离策略演员-评论家学习中存在的不稳定性和收敛性问题。
- 通过允许多个智能体共享同一经验回放缓冲区,提升深度强化学习中的数据效率。
- 通过分析 V-trace 在离策略设置下的局限性,克服其偏差-方差权衡问题。
- 开发一种信任区域方案,即使在强离策略采样下也能保证策略改进。
- 证明将在线策略经验与回放经验混合对于收敛性和性能至关重要。
提出的方法
- 提出一种混合训练策略,将在线策略经验与来自共享回放缓冲区的离策略经验结合,以减少 V-trace 中的偏差。
- 在策略空间中引入信任区域方案,通过约束更新以保持稳定性,从而保证策略改进。
- 使用带重要性采样修正的 V-trace 实现离策略校正,但通过在线策略混合与信任区域约束减轻其偏差。
- 在多个智能体之间实现共享回放缓冲区,以支持并行探索并减少内存占用。
- 在共享设置中采用均匀经验回放而非优先级经验回放,以避免智能体间度量冲突。
- 使用共享经验的群体基于训练(PBT)方法训练智能体,实现高效的超参数搜索。
实验结果
研究问题
- RQ1在无在线策略经验的情况下,使用经验回放的离策略演员-评论家学习能否收敛至局部最优策略?
- RQ2混合在线策略与离策略经验对离策略演员-评论家方法中 V-trace 的稳定性和性能有何影响?
- RQ3共享经验回放对并发超参数搜索中的数据效率与训练速度有何影响?
- RQ4信任区域方案是否能稳定强离策略场景下的学习,即使 V-trace 在此类场景中变得不稳定?
- RQ5在多智能体共享回放设置中,均匀经验回放是否优于优先级经验回放?
主要发现
- 将在线策略经验与回放经验混合可显著提升性能并确保收敛;纯离策略 V-trace 即使使用最优价值函数也无法收敛。
- LASER 采用共享经验回放,在 200M 环境步数内于 57 个 Atari 游戏上达到 448% 的人类标准化得分,优于以往方法(后者需超过 30 亿步才能突破 400%)。
- 最佳性能在 1000 万回放缓冲区与 87.5% 回放比例(7:1 回放与在线比例)下实现,表明在中等回放容量下具备极高的数据效率。
- 共享经验回放使 10 个智能体的超参数搜索中内存使用减少 10 倍(从 1 亿降至 1000 万),同时支持并行探索与更快的超参数搜索。
- 信任区域方案使强离策略场景下的学习保持稳定,即使在共享经验下也优于非信任区域基线方法。
- LASER 在 100 亿步内于 DMLab-30 上实现 97.2% 的中位人类标准化性能,证明了其强大的多任务泛化能力与效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。