[论文解读] Learning from Trajectories via Subgoal Discovery
该论文提出了一种从专家轨迹中发现子目标的方法,以构建离散的外在奖励函数,从而在复杂且稀疏奖励的任务中实现高效学习。通过结合模仿学习与强化学习,并利用基于一类分类的子目标调制模块,该方法在专家轨迹质量不佳时,仍优于最先进(SOTA)的强化学习、模仿学习及混合方法,在MuJoCo任务中表现更优。
Learning to solve complex goal-oriented tasks with sparse terminal-only rewards often requires an enormous number of samples. In such cases, using a set of expert trajectories could help to learn faster. However, Imitation Learning (IL) via supervised pre-training with these trajectories may not perform as well and generally requires additional finetuning with expert-in-the-loop. In this paper, we propose an approach which uses the expert trajectories and learns to decompose the complex main task into smaller sub-goals. We learn a function which partitions the state-space into sub-goals, which can then be used to design an extrinsic reward function. We follow a strategy where the agent first learns from the trajectories using IL and then switches to Reinforcement Learning (RL) using the identified sub-goals, to alleviate the errors in the IL step. To deal with states which are under-represented by the trajectory set, we also learn a function to modulate the sub-goal predictions. We show that our method is able to solve complex goal-oriented tasks, which other RL, IL or their combinations in literature are not able to solve.
研究动机与目标
- 为解决在仅终端奖励稀疏的复杂目标导向任务中,因需要过多环境交互而导致的学习效率低下问题。
- 通过不仅用于策略预训练,还用于子目标发现以塑造奖励函数,从而改进模仿学习。
- 通过学习一个能泛化到未充分覆盖状态的子目标预测器,减少对专家质量与覆盖范围的依赖,方法基于一类分类。
- 通过将连续且可能出错的价值函数转化为离散的结构化子目标奖励,实现更快、更可靠的强化学习。
提出的方法
- 该方法首先在专家轨迹上进行监督预训练,以通过模仿学习初始化策略。
- 然后通过基于专家轨迹中时间顺序的状态空间划分来发现子目标,使用一个学习得到的函数 $ u_{\psi} $ 识别路径上的关键点。
- 利用这些子目标构建离散的外在奖励函数,在强化学习微调过程中提供结构化且非稀疏的奖励信号。
- 为处理专家轨迹未覆盖的分布外状态,引入一类分类模块来调制子目标预测,提升泛化能力。
- 代理从模仿学习过渡到强化学习,利用基于子目标的奖励来缓解初始模仿阶段引入的错误。
- 奖励函数在公式(5)中形式化表达,使用 $ u_{\psi} $,从而在稀疏奖励环境中提升学习的稳定性和性能。
实验结果
研究问题
- RQ1从专家轨迹中发现子目标是否能提升复杂稀疏奖励任务中的样本效率与性能?
- RQ2与基于连续价值的奖励塑造相比,基于子目标的离散奖励塑造在学习稳定性与收敛性方面表现如何?
- RQ3该方法能否泛化到专家轨迹未覆盖的状态?一类分类模块如何提升鲁棒性?
- RQ4该方法是否在具有稀疏奖励的挑战性MuJoCo任务中,优于最先进(SOTA)的强化学习、模仿学习及混合方法?
主要发现
- 该方法成功解决了三个复杂的MuJoCo任务——BiMGame、AntTarget和AntMaze,而最先进(SOTA)的强化学习、模仿学习及混合方法在这些任务中无法稳定学习。
- 通过使用子目标调制器 $ u_{\psi} $,该方法在AntMaze和BiMGame上实现了更优性能,尤其在避免因专家覆盖稀疏导致的局部最优方面表现突出。
- 即使使用次优的专家轨迹,该方法仍优于专家本身,展现出对专家质量的强鲁棒性。
- 子目标发现机制能有效识别瓶颈区域(如BiMGame中的关键区域),并实现路径的均匀划分(如AntTarget和AntMaze),显示出对不同任务结构的适应能力。
- 与连续价值基奖励相比,使用离散子目标奖励显著提升了学习效果,尤其在专家轨迹有限或长时序任务中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。