[论文解读] Continual Learning of Control Primitives: Skill Discovery via Reset-Games
该论文提出了一种通用和博弈的'重置博弈'框架,通过将重置需求建模为学习多样化控制基元的训练信号,同时实现免重置强化学习与无监督技能发现。通过让任务策略与重置策略在竞争性博弈中相互对抗,该方法在无需人工重置的情况下学习到鲁棒且可迁移的技能,在模拟和真实世界设置中的长时程下游任务上显著提升了性能。
Reinforcement learning has the potential to automate the acquisition of behavior in complex settings, but in order for it to be successfully deployed, a number of practical challenges must be addressed. First, in real world settings, when an agent attempts a task and fails, the environment must somehow "reset" so that the agent can attempt the task again. While easy in simulation, this could require considerable human effort in the real world, especially if the number of trials is very large. Second, real world learning often involves complex, temporally extended behavior that is often difficult to acquire with random exploration. While these two problems may at first appear unrelated, in this work, we show how a single method can allow an agent to acquire skills with minimal supervision while removing the need for resets. We do this by exploiting the insight that the need to "reset" an agent to a broad set of initial states for a learning task provides a natural setting to learn a diverse set of "reset-skills". We propose a general-sum game formulation that balances the objectives of resetting and learning skills, and demonstrate that this approach improves performance on reset-free tasks, and additionally show that the skills we obtain can be used to significantly accelerate downstream learning.
研究动机与目标
- 为解决真实世界机器人中非回合制、免重置强化学习的挑战,其中人工重置成本高且不切实际。
- 在无人类提供的奖励塑造或监督的情况下,发现多样化、时序扩展的控制基元(技能)。
- 将技能发现与免重置学习的目标统一到一个协同训练的单一框架中。
- 通过利用与任务策略对抗交互所学习的技能,提升样本效率与长时程任务的下游性能。
- 证明在免重置、对抗性设置下学习的技能比以往的无监督或基于重置的方法更具有效性与泛化能力。
提出的方法
- 构建任务策略与重置策略之间的通用和博弈框架,其中任务策略尝试完成给定任务,而重置策略则旨在扰动状态以增加任务难度。
- 使用共享潜在空间表示技能,使重置策略能够为任务策略生成多样化的初始状态。
- 采用双目标训练信号:任务策略针对任务成功进行优化,而重置策略则针对发现对任务策略具有挑战性的状态进行优化,从而促进技能多样性。
- 引入类似课程的训练调度,逐步让任务策略接触更复杂的初始状态,以提升其鲁棒性。
- 利用状态表示(完整状态或(x,y)位置)引导技能学习,消融实验表明不同表示下均能提升泛化能力。
- 对两个策略均使用离策略强化学习算法(如SAC),实现在连续控制环境中的样本高效训练。
实验结果
研究问题
- RQ1单一训练框架是否能同时实现免重置学习与有效的技能发现,且无需人工监督?
- RQ2任务策略与重置策略之间的对抗性交互是否能产生比标准无监督方法更丰富、更有用的技能?
- RQ3在免重置设置下学习的技能是否能泛化到下游长时程任务,并优于依赖重置的方法?
- RQ4状态表示的选择(如完整状态与(x,y))如何影响所学重置技能的质量与泛化能力?
- RQ5与以往的无监督及基于重置的技能学习方法相比,该方法在多大程度上提升了样本效率与下游性能?
主要发现
- 所提出的重置博弈方法在下游Ant-MediumMaze任务中获得的回报显著高于以往无监督方法,在相同免重置设置下,性能最高达到DADS与DIAYN的2.5倍。
- 在Ant-WayPoints导航任务中,该方法在完整状态与(x,y)表示设置下均优于基线方法,证明了对状态表示选择的鲁棒性。
- 通过重置博弈学习的技能覆盖的态空间显著更广:在Ant环境中,轨迹可实现更长距离移动(如>10m),而以往方法仅能学习短距离方向性行走。
- 该方法实现了有效的免重置学习,无需使用oracle重置,在以往方法因缺乏重置而失败的环境中仍能实现稳定训练与收敛。
- 消融实验证明,重置博弈中的对抗性目标至关重要:移除该目标后,技能多样性下降且下游性能变差,证实挑战性在提升技能质量中的关键作用。
- 技能发现更具多样性且适用于分层控制,分层策略在免重置、完整状态设置下成功导航了复杂迷宫。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。