[论文解读] Reincarnating Reinforcement Learning: Reusing Prior Computation to Accelerate Progress
本文提出再生式强化学习(Reincarnating Reinforcement Learning, RRL),一种可重用先前计算工作(如预训练策略和回放缓冲区)以加速设计迭代或在不同智能体间加速强化学习训练的框架。通过采用基于QDagger的离线预训练与在线微调,RRL在Atari、运动控制和真实世界气球导航任务中,仅使用比从零开始训练少95%的帧数,即达到相当的性能,展现出显著的样本效率。
Learning tabula rasa, that is without any prior knowledge, is the prevalent workflow in reinforcement learning (RL) research. However, RL systems, when applied to large-scale settings, rarely operate tabula rasa. Such large-scale systems undergo multiple design or algorithmic changes during their development cycle and use ad hoc approaches for incorporating these changes without re-training from scratch, which would have been prohibitively expensive. Additionally, the inefficiency of deep RL typically excludes researchers without access to industrial-scale resources from tackling computationally-demanding problems. To address these issues, we present reincarnating RL as an alternative workflow or class of problem settings, where prior computational work (e.g., learned policies) is reused or transferred between design iterations of an RL agent, or from one RL agent to another. As a step towards enabling reincarnating RL from any agent to any other agent, we focus on the specific setting of efficiently transferring an existing sub-optimal policy to a standalone value-based RL agent. We find that existing approaches fail in this setting and propose a simple algorithm to address their limitations. Equipped with this algorithm, we demonstrate reincarnating RL's gains over tabula rasa RL on Atari 2600 games, a challenging locomotion task, and the real-world problem of navigating stratospheric balloons. Overall, this work argues for an alternative approach to RL research, which we believe could significantly improve real-world RL adoption and help democratize it further. Open-sourced code and trained agents at https://agarwl.github.io/reincarnating_rl.
研究动机与目标
- 为解决在大规模和真实世界应用中从零开始(tabula rasa)训练强化学习智能体所面临的高计算成本和低效问题。
- 使缺乏工业级资源的研究人员能够通过重用现有策略和数据来应对复杂的强化学习问题。
- 形式化一种新的研究工作流——再生式RL,以在智能体迭代或不同智能体之间重用先前的计算工作。
- 通过从次优教师策略向学生智能体进行离线预训练和在线微调,实现知识迁移,从而提升强化学习的样本效率。
- 证明RRL可在显著减少训练帧数的情况下,达到或超越从零开始训练的性能。
提出的方法
- 提出两阶段RRL流程:首先使用源自教师策略的回放缓冲区进行离线预训练,随后通过学生智能体进行在线微调。
- 在离线和在线阶段均使用QDagger损失,以对齐学生智能体的价值函数与教师策略的行为。
- 采用类似蒸馏的过程,学生智能体从专家演示(通过回放缓冲区)中学习,并通过在线交互持续改进。
- 将该方法应用于从基于DQN的教师策略向独立的基于值函数的学生智能体(如DQN或Rainbow)的知识迁移。
- 使用人类归一化得分和IQM(四分位平均值)评估10款Atari游戏的表现,共50组随机种子,置信区间为95%。
- 采用课程式训练:先在大型回放缓冲区上进行离线预训练,然后以降低的学习率进行在线强化学习,以稳定学习过程。
实验结果
研究问题
- RQ1先前的计算工作(如预训练策略及其回放缓冲区)是否可被有效重用于加速强化学习训练?
- RQ2通过离线预训练和在线微调,从次优教师策略向学生智能体迁移知识,是否优于从零开始训练?
- RQ3离线回放缓冲区的大小如何影响再生过程中的性能表现?
- RQ4与标准Q-learning相比,在离线和在线阶段均使用QDagger损失,其影响如何?
- RQ5RRL是否能显著降低样本复杂度,同时在具有挑战性的强化学习基准上保持或提升性能?
主要发现
- 在微调后仅增加100万帧额外训练,再生式RL的IQM性能比从零开始训练的DQN(Adam)高出50%。
- 在再生后使用Adam优化器微调Nature DQN,仅用2000万帧即可达到使用4亿帧从零开始训练的DQN(Adam)的性能。
- 从DQN策略再生Impala-CNN Rainbow,其性能优于从零开始训练的Impala-CNN Rainbow,且仅用5000万帧即达到1亿帧的性能水平。
- 仅使用教师策略的50万次转移数据,性能即与使用100万次转移数据相当,仅在Asterix游戏中性能略有下降。
- 由教师训练期间使用多样化策略收集的离线回放缓冲区数据,其数据多样性优于在线策略数据,从而提升性能。
- 在离线和在线阶段均使用QDagger损失可获得更优结果,尤其在回放缓冲区大小受限时(如BLE运动控制任务中表现显著)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。