[论文解读] Lipschitz-constrained Unsupervised Skill Discovery
Lipschitz-constrained Skill Discovery (LSD) 提出了一种新颖的无监督技能发现方法,通过在状态表征上施加Lipschitz约束,以促进动态、远距离且多样的技能,相较于基于互信息(MI)的方法,在MuJoCo运动控制与操作环境中的技能多样性、状态空间覆盖度以及下游目标跟随任务的零样本性能方面表现更优。
We study the problem of unsupervised skill discovery, whose goal is to learn a set of diverse and useful skills with no external reward. There have been a number of skill discovery methods based on maximizing the mutual information (MI) between skills and states. However, we point out that their MI objectives usually prefer static skills to dynamic ones, which may hinder the application for downstream tasks. To address this issue, we propose Lipschitz-constrained Skill Discovery (LSD), which encourages the agent to discover more diverse, dynamic, and far-reaching skills. Another benefit of LSD is that its learned representation function can be utilized for solving goal-following downstream tasks even in a zero-shot manner - i.e., without further training or complex planning. Through experiments on various MuJoCo robotic locomotion and manipulation environments, we demonstrate that LSD outperforms previous approaches in terms of skill diversity, state space coverage, and performance on seven downstream tasks including the challenging task of following multiple goals on Humanoid. Our code and videos are available at https://shpark.me/projects/lsd/.
研究动机与目标
- 解决基于互信息(MI)的技能发现方法因对缩放和可逆变换的不变性而倾向于静态、低变化技能的局限性。
- 克服对人工特征工程或领域特定先验知识(如x-y坐标)的依赖,以促进动态运动或操作技能的生成。
- 设计一种技能发现目标函数,其能内在地促进大范围的状态空间变化与长距离行为,而无需外部奖励信号。
- 利用学习到的表征实现对下游目标跟随任务的零样本迁移,无需额外训练或复杂规划。
- 提供一种简单、无需超参数调节的方法,在保持强大下游性能的同时提升技能多样性与覆盖度。
提出的方法
- 提出一种Lipschitz约束目标函数,通过将表征函数限制为Lipschitz连续且有界常数,以最大化在状态空间中行进的距离。
- 将技能发现目标函数表述为技能与状态之间互信息的正则化最大化问题,并引入Lipschitz惩罚项以偏好大范围的状态变化。
- 采用对比学习框架训练策略网络,将技能潜在变量映射为动作,确保不同潜在变量产生显著且远距离的状态轨迹。
- 通过简单的线性层直接回归技能潜在变量到目标状态,利用学习到的表征实现零样本目标跟随。
- 通过冻结技能策略并在其之上训练分层元控制器,将方法与标准强化学习流水线集成,用于下游任务。
- 在无需任务特定奖励或内在奖励塑造的情况下,将方法应用于运动控制(Ant, Humanoid)与操作(Fetch)环境中的预训练阶段。
实验结果
研究问题
- RQ1对状态表征函数施加Lipschitz约束是否能有效促进无监督技能发现中的动态与多样化技能?
- RQ2LSD是否在无需人工特征工程的前提下,于状态空间覆盖度与技能多样性方面优于基于MI的基线方法?
- RQ3LSD学习到的表征是否能实现对多个目标的零样本目标跟随,而无需进一步训练或复杂规划?
- RQ4在Humanoid中的多目标导航与Fetch中的物体操作等复杂下游任务中,LSD的表现如何?
- RQ5LSD在包括运动控制与操作在内的多种机器人控制任务中是否具备鲁棒性与泛化能力?
主要发现
- 在五个MuJoCo环境中,LSD实现了最高的状态空间覆盖度,显著优于基于MI的基线方法(如DIAYN与MDP)。
- 在AntMultiGoals与HumanoidMultiGoals任务中,LSD取得了最高的最终累积奖励,甚至超越了使用任务特定内在奖励或先验知识的方法。
- LSD在无需微调的零样本技能选择中表现最佳,于AntMultiGoals任务中表现优异,并在其他任务中保持竞争力,展现出强大的泛化能力。
- 在Fetch操作任务中,LSD学习到的技能能够以最多样化的方式在x-y平面上移动目标物体,如轨迹图所示。
- 在所有三个Fetch环境中,LSD在状态空间覆盖度(以0.1×0.1网格为单位)上均取得最佳表现,表明其探索能力与技能多样性更优。
- 该方法无需额外超参数,易于实现,同时仍优于需特征工程或内在奖励的复杂基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。