[论文解读] Improving Policy Optimization with Generalist-Specialist Learning
本文提出通用-专用学习(Generalist-Specialist Learning, GSL),一种元算法,通过先在所有环境变体上训练一个通用智能体,然后在表现不佳的子集上启动专用智能体以生成高质量示范,再将这些示范作为辅助奖励来微调通用智能体,从而帮助其突破性能瓶颈,在Procgen、Meta-World和ManiSkill等挑战性基准上实现显著更高的回报。
Generalization in deep reinforcement learning over unseen environment variations usually requires policy learning over a large set of diverse training variations. We empirically observe that an agent trained on many variations (a generalist) tends to learn faster at the beginning, yet its performance plateaus at a less optimal level for a long time. In contrast, an agent trained only on a few variations (a specialist) can often achieve high returns under a limited computational budget. To have the best of both worlds, we propose a novel generalist-specialist training framework. Specifically, we first train a generalist on all environment variations; when it fails to improve, we launch a large population of specialists with weights cloned from the generalist, each trained to master a selected small subset of variations. We finally resume the training of the generalist with auxiliary rewards induced by demonstrations of all specialists. In particular, we investigate the timing to start specialist training and compare strategies to learn generalists with assistance from specialists. We show that this framework pushes the envelope of policy learning on several challenging and popular benchmarks including Procgen, Meta-World and ManiSkill.
研究动机与目标
- 解决在大量多样化环境变体上训练时深度强化学习策略优化出现性能平台期的挑战。
- 在高方差环境中训练神经网络时,克服灾难性遗忘和灾难性无知问题。
- 结合通用智能体与专用智能体的优势:通用智能体实现快速初始学习,专用智能体在特定子集上实现高性能。
- 开发一种可扩展、高效的框架,在不修改现有强化学习算法架构的前提下,提升复杂基准上的样本效率和最终性能。
提出的方法
- 使用标准强化学习算法(如PPO)在所有环境变体上训练通用策略,以实现快速的早期学习。
- 基于训练回报趋势,采用一种简单且自适应的平台期检测准则($\mathcal{H}$)识别通用智能体的性能平台期。
- 从通用智能体的权重初始化一组合集的专用智能体,并在最表现不佳的环境变体子集中进行训练。
- 将所有专用智能体的示范作为辅助奖励,用于微调通用智能体,通过模仿高性能行为来提升其策略。
- 谨慎选择专用智能体到通用智能体的示范整合方法——DAPG在处理不一致的专家示范方面优于BC。
- 将该框架作为元算法应用于现有的强化学习与模仿学习流程,无需对基础强化学习算法进行任何修改。
实验结果
研究问题
- RQ1在所有环境变体上训练通用智能体后,再进行有针对性的专用智能体训练,是否能相比仅训练通用智能体显著提升最终策略性能?
- RQ2启动专用智能体训练的时间点如何影响通用智能体的整体效率和最终性能?
- RQ3不同示范整合方法(如BC与DAPG)对通用智能体泛化能力及实现高回报的影响如何?
- RQ4该框架是否能有效缓解在多样化环境中训练时神经网络策略的灾难性遗忘和灾难性无知问题?
- RQ5该框架是否能在无需架构修改的前提下,有效应用于Procgen、ManiSkill和Meta-World等多样化基准?
主要发现
- 采用DAPG作为整合方法的GSL框架在BigFish(Procgen)上实现了30.0 ± 0.5的测试回报,显著优于单一PPO通用智能体(24.3 ± 1.1)及其他基线方法。
- 在GSL中使用行为克隆(BC)整合专用智能体示范导致性能下降,表明BC在面对不一致的专家示范时具有破坏性。
- 该框架对启动专用智能体训练的时间点具有鲁棒性,相较于最优时间点提前或延后5%,性能差异微小。
- 在通用智能体表现最低的25%环境变体上进行专用智能体训练,带来了最有效的性能提升,验证了该策略的有效性。
- 在1,000个未见的BigFish新关卡的保留测试集中,GSL+DAPG保持了优越的泛化性能,表明该方法同时增强了零样本和分布外泛化能力。
- 该框架在Procgen、Meta-World和ManiSkill等多个基准上实现了最先进性能,展示了其广泛的适用性和有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。