[论文解读] Goal-Conditioned Reinforcement Learning with Imagined Subgoals
本论文提出 RIS,一种方法,通过高层策略生成的设想子目标并通过对先验的 KL 散度正则化来加速学习用于时序延展任务的目标条件策略;在测试阶段仅使用平面策略(flat policy)。
Goal-conditioned reinforcement learning endows an agent with a large variety of skills, but it often struggles to solve tasks that require more temporally extended reasoning. In this work, we propose to incorporate imagined subgoals into policy learning to facilitate learning of complex tasks. Imagined subgoals are predicted by a separate high-level policy, which is trained simultaneously with the policy and its critic. This high-level policy predicts intermediate states halfway to the goal using the value function as a reachability metric. We don't require the policy to reach these subgoals explicitly. Instead, we use them to define a prior policy, and incorporate this prior into a KL-constrained policy iteration scheme to speed up and regularize learning. Imagined subgoals are used during policy learning, but not during test time, where we only apply the learned policy. We evaluate our approach on complex robotic navigation and manipulation tasks and show that it outperforms existing methods by a large margin.
研究动机与目标
- 促进处理时序上延展推理的目标条件化 RL
- 提出设想中的子目标以引导和加速策略学习
- 学习一个预测子目标的高层策略以及用于 KL 正则化策略更新的先验
- 在测试时实现单一的平滑策略,能够实现到达遥远目标
- 在模拟机器人导航与操作任务中展示样本高效学习
提出的方法
- 引入由高层策略预测的设想子目标,该高层策略与目标策略及其评估器共同训练
- 将先验策略定义为到达设想子目标所需的动作分布,并用朝向该先验的 KL 约束来正则化目标条件策略
- 使用当前价值函数定义状态之间的距离,以引导子目标的选择
- 将子目标预测为从当前状态到目标路径上的中点,以降低预测时域
- 训练一个非参数的高层策略,并通过基于 KL 的更新将其投影到参数化空间(方程 6–7)
- 采用带 HER 的离策略 actor-critic 框架来应对稀疏奖励(算法 1)
实验结果
研究问题
- RQ1设想的子目标是否能在长期任务中加速目标条件化 RL 的学习?
- RQ2高层策略如何预测子目标以有效地对平面策略进行正则化并指导其学习?
- RQ3朝向一个子目标信息先验的 KL 正则化是否能提高稳定性和样本效率?
- RQ4RIS 是否能从导航任务泛化到具像素输入的视觉操作任务?
- RQ5尽管训练使用子目标,测试时是否能通过单一策略达到良好性能?
主要发现
- RIS 在蚂蚁导航迷宫和基于视觉的操作任务中,大幅提升相对于 SAC+HER、LEAP 和 TDM 的样本效率
- 高层策略在训练过程中学到的子目标与 oracle(轨迹中的中点)相符
- 隐式 KL 正则化使设想的子目标保持在有效状态分布内,防止发散
- 在视觉任务中,设想子目标使 RIS 在计算量更少的情况下优于 SAC 和 LEAP(单次前向传播 vs 规划)
- 通过移动平均得到的平均子目标先验稳定了训练并支持收敛
- RIS 能解决传统方法难以处理的日益困难的时域任务
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。