Skip to main content
QUICK REVIEW

[论文解读] Residual Skill Policies: Learning an Adaptable Skill-based Action Space for Reinforcement Learning for Robotics

Krishan Rana, Ming Xu|arXiv (Cornell University)|Nov 4, 2022
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出残差技能策略(ReSkill),一种强化学习框架,通过使用状态条件生成模型引导探索至相关技能,并引入低层级残差策略以适应任务变化,从而加速基于技能的学习。与先前方法相比,该方法在四个未见过的操控任务中实现了更快的收敛速度和更高的最终性能。

ABSTRACT

Skill-based reinforcement learning (RL) has emerged as a promising strategy to leverage prior knowledge for accelerated robot learning. Skills are typically extracted from expert demonstrations and are embedded into a latent space from which they can be sampled as actions by a high-level RL agent. However, this skill space is expansive, and not all skills are relevant for a given robot state, making exploration difficult. Furthermore, the downstream RL agent is limited to learning structurally similar tasks to those used to construct the skill space. We firstly propose accelerating exploration in the skill space using state-conditioned generative models to directly bias the high-level agent towards only sampling skills relevant to a given state based on prior experience. Next, we propose a low-level residual policy for fine-grained skill adaptation enabling downstream RL agents to adapt to unseen task variations. Finally, we validate our approach across four challenging manipulation tasks that differ from those used to build the skill space, demonstrating our ability to learn across task variations while significantly accelerating exploration, outperforming prior works. Code and videos are available on our project website: https://krishanrana.github.io/reskill.

研究动机与目标

  • 为解决在大型通用技能空间中探索效率低下问题,通过学习状态条件技能先验,使采样偏向于相关技能。
  • 通过引入低层级残差策略,使下游强化学习智能体能够适应未见的任务变化。
  • 通过利用经典控制器作为技能数据来源,减少对详尽专家示范的依赖。
  • 在不将任务分布限制于原始技能训练数据的前提下,提升基于技能的强化学习的样本效率和最终性能。
  • 在技能空间构建过程中未见过的多样化操控任务上实现泛化能力。

提出的方法

  • 基于归一化流的、状态条件的技能先验被训练以建模给定机器人状态下相关技能的多模态条件密度,从而实现对状态相关技能的直接采样。
  • 通过变分自编码器(VAE)学习技能先验,将专家示范嵌入连续潜在技能空间,随后通过流模型转换以建模复杂且多模态的分布。
  • 引入低层级残差策略,用于预测对高层技能动作的修正,从而实现对环境变化(如物体位置、摩擦力或障碍物)的细粒度适应。
  • 高层强化学习智能体在技能空间中运行,其动作由状态条件技能先验采样得到,而残差策略则提供单步动作访问以实现精确控制。
  • 该框架采用端到端训练方式,高层策略通过强化学习进行优化,而技能先验和残差策略在下游训练期间保持冻结以维持策略稳定性。
  • 该方法采用两阶段训练流程:首先在专家示范上预训练技能嵌入和先验模块,随后在下游任务上微调高层策略。

实验结果

研究问题

  • RQ1状态条件的生成模型是否能通过仅采样当前状态相关的技能,有效引导在大型多模态技能空间中的探索?
  • RQ2低层级残差策略在多大程度上能够实现对未见任务变化(如物体位置、摩擦力或障碍物)的技能适应?
  • RQ3与标准基于技能的强化学习相比,技能先验与残差策略的结合在样本效率和最终性能方面有何提升?
  • RQ4在有限任务集上预训练的技能空间是否能泛化到更广泛的操控任务,而无需新的专家示范?
  • RQ5技能先验与残差策略对整体学习速度和最终性能的相对贡献分别是什么?

主要发现

  • 与基线方法相比,ReSkill 显著加速了学习过程,在堆叠和复杂挂钩任务中收敛更快,如消融研究所示。
  • ReSkill(无技能先验)变体在复杂堆叠任务中无法有效学习,表明状态条件技能先验在早期阶段引导探索相关技能方面具有关键作用。
  • ReSkill(无残差)变体的最终性能低于完整ReSkill模型,证实残差适应对于复杂任务的高渐近性能至关重要。
  • 在所有四个操控任务(包括桌面清理和复杂挂钩)中,ReSkill在样本效率和最终回报方面均优于SPiRL及其他基于原子动作的方法。
  • 该方法能够有效复用少量经典控制器来解决此前未见过的广泛任务,展示了超越原始技能分布的强大泛化能力。
  • 消融研究证实,技能先验实现了对相关技能的直接、有针对性采样,避免了KL正则化方法(如SPiRL)所需的‘预热’阶段。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。