Skip to main content
QUICK REVIEW

[论文解读] Generalization, Mayhems and Limits in Recurrent Proximal Policy Optimization

Marco Pleines, Matthias Pallasch|arXiv (Cornell University)|May 23, 2022
Adversarial Robustness in Machine Learning被引用 10
一句话总结

本文提供了使用截断时间反向传播(TBPTT)正确实现循环PPO的详细指南,强调了数据处理、隐藏状态管理和损失掩码的重要性。文章引入了两个新型环境——Mortar Mayhem 和 Searing Spotlights,用于测试记忆能力的极限与干扰情况。在增加训练种子数量时,Mortar Mayhem 展现出优异的泛化能力,但在 Searing Spotlights 中则失败,揭示了在高干扰条件下循环PPO的固有局限性。

ABSTRACT

At first sight it may seem straightforward to use recurrent layers in Deep Reinforcement Learning algorithms to enable agents to make use of memory in the setting of partially observable environments. Starting from widely used Proximal Policy Optimization (PPO), we highlight vital details that one must get right when adding recurrence to achieve a correct and efficient implementation, namely: properly shaping the neural net's forward pass, arranging the training data, correspondingly selecting hidden states for sequence beginnings and masking paddings for loss computation. We further explore the limitations of recurrent PPO by benchmarking the contributed novel environments Mortar Mayhem and Searing Spotlights that challenge the agent's memory beyond solely capacity and distraction tasks. Remarkably, we can demonstrate a transition to strong generalization in Mortar Mayhem when scaling the number of training seeds, while the agent does not succeed on Searing Spotlights, which seems to be a tough challenge for memory-based agents.

研究动机与目标

  • 解决在部分可观察环境中将循环机制集成到近端策略优化(PPO)中的关键但记录不足的工程挑战。
  • 提供一个完整文档化、可投入生产的循环PPO实现,支持视觉观测和离散动作空间的截断BPTT。
  • 引入新型环境——Mortar Mayhem 和 Searing Spotlights,用于测试记忆能力的极限与干扰,从而实现对基于记忆的智能体更深入的评估。
  • 研究循环PPO在处理高干扰性和长时序记忆任务时的极限,特别是在动态、噪声环境下的表现。
  • 考察隐藏状态陈旧性和优势归一化对在线策略强化学习中训练稳定性和性能的影响。

提出的方法

  • 采用截断时间反向传播(TBPTT)高效训练具有长序列的循环PPO,实现对扩展时间上下文的梯度传播。
  • 设计神经网络前向传播过程,正确初始化隐藏状态,并在时间步之间实现递归。
  • 在损失计算中使用序列填充与掩码,防止对填充时间步进行梯度更新,确保训练稳定性。
  • 使用一致的初始化策略在序列起始处采样隐藏状态,避免梯度消失或数据泄露。
  • 设计自定义环境——Mortar Mayhem 和 Searing Spotlights——要求智能体在长时序内维持并更新记忆,任务需同时具备记忆保持与动态记忆更新能力。
  • 实现基线训练流程,每个实验使用5个随机种子,每个评估使用10个新种子,支持稳健的泛化性分析。

实验结果

研究问题

  • RQ1在视觉输入和离散动作空间下,正确且高效地将循环机制集成到近端策略优化(PPO)中的关键实现细节是什么?
  • RQ2在Mortar Mayhem等记忆密集型环境中,增加训练种子数量如何影响泛化性能?
  • RQ3当在多样化种子上进行训练时,循环PPO在泛化到新型未见环境方面的能力如何,尤其与现有的ballet环境基准相比?
  • RQ4在Searing Spotlights环境等高干扰任务中,循环PPO的固有局限性是什么?
  • RQ5在在线策略设置中,刷新陈旧的隐藏状态和优势值是否能提升循环PPO的训练稳定性和性能?

主要发现

  • 当增加训练种子数量时,Mortar Mayhem 中出现了显著的泛化能力,表明多样化经验有助于零样本泛化到新种子。
  • 即使在简化版本中,智能体仍无法解决Searing Spotlights,表明随机移动的聚光灯创造了标准循环PPO难以应对的噪声环境。
  • 刷新陈旧隐藏状态和优势值并未带来性能提升,表明在测试设置中引入此计算开销并无益处。
  • 采用正确掩码、序列处理和TBPTT的基线实现实现了稳定训练和正确行为,验证了工程流程的有效性。
  • ballet环境在训练种子上表现优异,但在新种子上表现低于随机水平,表明泛化能力弱,与Mortar Mayhem形成鲜明对比。
  • 结果表明,可能需要基于Transformer的事件记忆机制(如分层分块注意力记忆)来克服循环PPO在高度干扰环境中的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。