[论文解读] Continuous-action Reinforcement Learning for Playing Racing Games: Comparing SPG to PPO
本文为 OpenAI Gym 引入了一个连续控制的赛车环境,并在随机生成的赛道上对比了采样策略梯度(SPG)与近端策略优化(PPO)在车辆控制学习中的表现。论文提出了 SPG 的加权动作采样扩展方法,以及一种混合经验回放技术,该技术在不损失性能的前提下提升了训练速度。研究发现,结合经验回放的 SPG 表现优于 PPO,而 PPO 在连续动作空间中并未从经验回放中受益。
In this paper, a novel racing environment for OpenAI Gym is introduced. This environment operates with continuous action- and state-spaces and requires agents to learn to control the acceleration and steering of a car while navigating a randomly generated racetrack. Different versions of two actor-critic learning algorithms are tested on this environment: Sampled Policy Gradient (SPG) and Proximal Policy Optimization (PPO). An extension of SPG is introduced that aims to improve learning performance by weighting action samples during the policy update step. The effect of using experience replay (ER) is also investigated. To this end, a modification to PPO is introduced that allows for training using old action samples by optimizing the actor in log space. Finally, a new technique for performing ER is tested that aims to improve learning speed without sacrificing performance by splitting the training into two parts, whereby networks are first trained using state transitions from the replay buffer, and then using only recent experiences. The results indicate that experience replay is not beneficial to PPO in continuous action spaces. The training of SPG seems to be more stable when actions are weighted. All versions of SPG outperform PPO when ER is used. The ER trick is effective at improving training speed on a computationally less intensive version of SPG.
研究动机与目标
- 开发一种新颖且可扩展的连续动作赛车环境,用于基准测试深度强化学习算法。
- 在具有复杂、类现实世界动力学的连续控制设置中,比较 SPG 与 PPO 的性能。
- 研究经验回放对连续动作空间中 PPO 与 SPG 的影响。
- 提出并评估一种新型混合经验回放技术,以在保持性能的同时提升训练速度。
- 引入并测试一种针对 SPG 的加权动作采样方法,以提升训练稳定性和性能。
提出的方法
- 在 OpenAI Gym 中开发了自定义赛车环境,具有连续状态和动作空间,模拟了包括速度、转向和赛道约束在内的现实世界汽车动力学。
- 实现了 SPG,采用 Q 值网络进行动作采样并更新策略,使用加权采样策略,在策略更新期间优先选择高价值动作。
- 对 PPO 进行修改,使其在对数空间中运行,通过重加权旧动作概率,使经验回放能够在连续动作空间中应用。
- 提出一种混合经验回放技术,将训练分为两个阶段:首先在经验回放缓冲区的转移数据上训练,然后在近期经验上继续训练,以在保持性能的同时加速学习。
- 使用带有 tanh 激活函数的多层感知机(MLPs)作为策略网络和评论家网络,每轮训练采用独立的优化步骤和小批量随机梯度下降(SGD)。
- 每种算法进行五次独立运行,使用不同随机生成的赛道,以确保统计稳健性和公平性。
实验结果
研究问题
- RQ1在连续动作强化学习任务中,经验回放是否能提升 PPO 的学习性能?
- RQ2加权动作采样策略是否能增强 SPG 在连续控制任务中的稳定性和性能?
- RQ3一种结合旧经验与近期经验的混合经验回放方法,如何影响 SPG 的训练速度和最终性能?
- RQ4在连续动作赛车环境中,SPG 是否优于 PPO,尤其是在应用经验回放的情况下?
- RQ5所提出的对数空间 PPO 变体在多大程度上实现了连续动作空间中经验回放的有效应用?
主要发现
- 在连续动作空间中,经验回放并未提升 PPO 的性能,标准版本与对数空间版本结果几乎完全相同,且未从回放中获得显著收益。
- 混合经验回放技术显著提升了 SPG 的训练速度,同时保持或超越了最终性能,优于标准 SPG 和多轮次 SPG 变体。
- SPG 中的加权动作采样带来了更稳定的训练过程,减少了性能波动和方差,但对最终性能的提升并不显著。
- 结合经验回放的 SPG 在所有配置下均持续优于 PPO,且采用混合回放的单轮次 SPG 变体在性能上可与更慢的多轮次版本相当。
- PPO 无法从经验回放中受益,且使用混合回放数据的对数空间变体出现了梯度爆炸问题,导致长期训练受阻。
- 多轮次 SPG 变体的稳定性低于单轮次版本,表现出更频繁的负奖励尖峰,表明 SPG 可能更适合采用更简单的训练调度策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。