[论文解读] ViZDoom: DRQN with Prioritized Experience Replay, Double-Q Learning, & Snapshot Ensembling
本文在深度循环Q网络(DRQN)中评估了双Q学习(DDQ)和优先经验回放(PER)在ViZDoom第一人称射击环境中的表现,结合余弦退火的快照集成方法以提升性能。结果表明,DDQ与PER均显著增强了学习稳定性和早期性能,快照集成使平均K/D提升超过一个标准差。
ViZDoom is a robust, first-person shooter reinforcement learning environment, characterized by a significant degree of latent state information. In this paper, double-Q learning and prioritized experience replay methods are tested under a certain ViZDoom combat scenario using a competitive deep recurrent Q-network (DRQN) architecture. In addition, an ensembling technique known as snapshot ensembling is employed using a specific annealed learning rate to observe differences in ensembling efficacy under these two methods. Annealed learning rates are important in general to the training of deep neural network models, as they shake up the status-quo and counter a model's tending towards local optima. While both variants show performance exceeding those of built-in AI agents of the game, the known stabilizing effects of double-Q learning are illustrated, and priority experience replay is again validated in its usefulness by showing immediate results early on in agent development, with the caveat that value overestimation is accelerated in this case. In addition, some unique behaviors are observed to develop for priority experience replay (PER) and double-Q (DDQ) variants, and snapshot ensembling of both PER and DDQ proves a valuable method for improving performance of the ViZDoom Marine.
研究动机与目标
- 评估双Q学习(DDQ)与优先经验回放(PER)在ViZDoom强化学习环境中的有效性。
- 研究在DRQN架构中,结合DDQ与PER时,使用学习率退火的快照集成如何提升性能。
- 分析不同训练方法下代理策略的行为差异,例如弹药节约与对侧翼攻击的响应。
- 评估PER中价值过估计的影响及其对学习动态与集成有效性的作用。
- 在高延迟、部分可观测环境中,建立DRQN在使用与不使用先进深度强化学习技术情况下的性能基准。
提出的方法
- 采用受Lample等人启发的深度循环Q网络(DRQN)架构,以处理ViZDoom第一人称战斗场景中的序列观测。
- 应用双Q学习(DDQ)通过使用独立网络进行目标值估计,减少动作值的过估计。
- 实现优先经验回放(PER),聚焦于时间差误差较高的转移,提升样本效率。
- 使用学习率的余弦退火生成多样化的模型用于快照集成,即在不同训练阶段保存多个模型。
- 通过在单一DRQN模型上应用权重衰减与学习率调度,实施快照集成,并结合多个保存快照的预测结果。
- 在‘防守中心’ViZDoom场景中训练代理,通过平均K/D比率、标准差及敌方识别损失来衡量性能。
实验结果
研究问题
- RQ1双Q学习与优先经验回放如何影响ViZDoom环境中学习的稳定性和性能?
- RQ2优先经验回放中的价值过估计对早期学习与模型一致性有何影响?
- RQ3在DRQN代理中应用快照集成时,其有效性如何,尤其是在结合DDQ与PER的情况下?
- RQ4DDQ与PER代理是否发展出不同的行为策略,例如弹药节约或对侧翼攻击的快速响应?
- RQ5在高延迟、部分可观测环境(如ViZDoom)中,快照集成能否缓解性能下降?
主要发现
- 采用双Q学习(DDQ)的DRQN模型实现了平均K/D为3.90,标准差为0.393,表明其一致性更高且方差更小,优于基线代理。
- 优先经验回放(PER)实现了更快的早期学习,于1000局游戏内成功完成敌方检测,并将最大敌方识别交叉熵损失降低至0.2196。
- 快照集成显著提升了DDQ与PER代理的性能,使平均K/D提升超过一个标准差,其中DDQ集成模型达到4.37的平均K/D。
- 未使用PER或DDQ的基线DRQN模型平均K/D为4.65,但标准差高达0.620,表明性能不一致且稳定性差。
- DDQ代理通过更长时间保持射击延迟,展现出更好的弹药节约能力,减少误射;而PER代理对从后方或侧翼攻击的敌人反应更快。
- 快照集成未能提升基线DRQN模型的性能,表明在未正则化训练中,价值过估计的增加会导致模型差异过大,无法从集成平均中受益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。