[论文解读] DisCoRL: Continual Reinforcement Learning via Policy Distillation
DisCoRL 将状态表示学习与策略蒸馏相结合,在测试时不依赖任务标签的情况下,跨顺序任务执行持续强化学习,在仿真中评估并转移到现实生活。
In multi-task reinforcement learning there are two main challenges: at training time, the ability to learn different policies with a single model; at test time, inferring which of those policies applying without an external signal. In the case of continual reinforcement learning a third challenge arises: learning tasks sequentially without forgetting the previous ones. In this paper, we tackle these challenges by proposing DisCoRL, an approach combining state representation learning and policy distillation. We experiment on a sequence of three simulated 2D navigation tasks with a 3 wheel omni-directional robot. Moreover, we tested our approach's robustness by transferring the final policy into a real life setting. The policy can solve all tasks and automatically infer which one to run.
研究动机与目标
- 驱动自治体在测试时不遗忘地按顺序学习技能,并且不依赖任务标签。
- 开发一个将状态表示学习与策略蒸馏结合起来用于持续强化学习的管线。
- 证明蒸馏后的策略可以解决多个任务并转移到现实世界的机器人场景。
提出的方法
- 使用在 Env_i 中由随机策略收集的数据,通过 SRL 学习一个任务特定的状态表示编码器 E_i。
- 在学习到的状态空间中使用 RL 训练策略 pi_i。
- 通过沿着轨迹记录来自 pi_i 的观测值和行动概率来创建蒸馏数据集 D_pi_i。
- 通过将 D_pi_i 与以往的蒸馏数据集结合起来,并训练学生模仿教师,将 pi_i 蒸馏为共享策略 pi_d:(1..i)。
- 将蒸馏后的策略聚合为单一策略 pi_d:1..n,使其能够在没有任务指示符的情况下选择合适的动作。
- 在仿真中评估最终的蒸馏策略并通过领域随机化和 SRL 转移到现实生活。
实验结果
研究问题
- RQ1在测试时,单一蒸馏策略是否能在没有任务标签的情况下运行多个顺序RL任务?
- RQ2将 SRL 与策略蒸馏结合是否能在持续强化学习环境中防止对任务的遗忘?
- RQ3在域随机化条件下,蒸馏策略从仿真到实际机器人转移的效果如何?
主要发现
- 该管线在仿真中持续学习三个顺序的 2D 导航任务,并将最终策略转移到真实机器人。
- 策略蒸馏内存仅使用数据 (D_pi_i),而不是保存所有教师模型,从而实现可扩展的持续强化学习。
- 每个任务的 RL 策略 pi_i 高效学习,然后蒸馏为单一策略,相对于策略学习具有适度的计算成本。
- 该方法在测试时不需要任务标签,依赖视觉线索来推断当前任务。
- 实验包括域随机化以促进仿真到现实的转移,并显示对现实差距的鲁棒性。
- 每个任务的蒸馏数据集包含约 10k 个样本,相对于完整的 RL 训练实现更快的蒸馏。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。