[论文解读] Solving Compositional Reinforcement Learning Problems via Task Reduction
本文提出自模仿还原(Self-Imitation via Reduction, SIR),一种强化学习范式,通过状态空间扰动将困难任务简化为更易求解的变体,从而解决组合性、稀疏奖励的连续控制任务。通过模仿自身生成的解决方案轨迹,SIR 在无需分层策略或人工设计技能的情况下加速学习,在推、堆叠和导航任务上达到最先进性能。
We propose a novel learning paradigm, Self-Imitation via Reduction (SIR), for solving compositional reinforcement learning problems. SIR is based on two core ideas: task reduction and self-imitation. Task reduction tackles a hard-to-solve task by actively reducing it to an easier task whose solution is known by the RL agent. Once the original hard task is successfully solved by task reduction, the agent naturally obtains a self-generated solution trajectory to imitate. By continuously collecting and imitating such demonstrations, the agent is able to progressively expand the solved subspace in the entire task space. Experiment results show that SIR can significantly accelerate and improve learning on a variety of challenging sparse-reward continuous-control problems with compositional structures. Code and videos are available at https://sites.google.com/view/sir-compositional.
研究动机与目标
- 解决在稀疏奖励环境中学习复杂组合决策策略的挑战,且不依赖预定义技能或分层结构。
- 开发一种方法,通过自生成示范自然地将组合性归纳偏置融入策略学习。
- 通过迭代地将困难任务简化为已解决的任务并模仿其轨迹,实现对日益复杂任务的高效学习。
- 证明任务简化与模仿学习的结合可在具有挑战性的连续控制基准中超越课程学习和分层强化学习。
提出的方法
- SIR 通过扰动环境状态,将困难任务转化为具有已知解的更简单、可解的变体,实现任务简化。
- 智能体使用目标条件策略和通用价值函数,通过状态空间探索搜索并执行简化操作。
- 一旦通过简化解决了困难任务,其生成的轨迹即被收集为模仿学习的示范。
- 智能体在任务简化与模仿学习之间交替进行,逐步扩展任务空间中可解任务的集合。
- 在视觉环境中,SIR 使用预训练的 β-VAE 将图像嵌入低维潜在空间,通过 CEM 优化实现在潜在空间中的简化。
- SIR 可与任意表达能力强的策略架构配合使用,无需显式定义技能或选项,避免了分层强化学习的优化挑战。
实验结果
研究问题
- RQ1任务简化是否能实现对稀疏奖励连续控制环境中复杂组合策略的高效学习?
- RQ2SIR 在解决组合性任务时,相较于标准强化学习、模仿学习和分层强化学习的表现如何?
- RQ3SIR 是否能通过将困难任务简化为已解决任务,隐式构建课程,而无需人工设计课程?
- RQ4当结合 β-VAE 的表征学习时,SIR 是否能在视觉输入领域实现泛化?
- RQ5SIR 是否能与课程学习结合,解决任一方法单独均无法解决的任务?
主要发现
- SIR 显著加速并提升了在具有挑战性的稀疏奖励连续控制任务上的学习表现,包括机器人推、堆叠和迷宫导航。
- 在 4-Room 迷宫和 3-Room 迷宫环境中,SIR 在复杂场景下(需要组合策略)优于 PPO、SIL 和 HRL 基线方法(如 HIRO 和 DSC)。
- 使用均匀任务采样器的 SIR 表现优于基于 GoalGAN 的课程学习,后者需 10^6 个样本才能收敛,而 SIR 以轻量级、隐式的课程实现更优结果。
- 在视觉 U-Wall 迷宫任务中,结合 β-VAE 与 CEM 基础简化方法的 SIR 表现优于 PPO 和 SIL,证明其在图像输入场景下的有效性。
- SIR 与手动设计的课程结合,成功解决了课程学习单独无法解决的具有挑战性的堆叠任务。
- SIR 在基于物体的状态空间和视觉状态空间中均保持强大性能,展现出广泛的适用性和鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。