[论文解读] Learning Goal Embeddings via Self-Play for Hierarchical Reinforcement Learning
该论文提出了一种无监督自对弈框架,用于学习连续的目标嵌入和低层次策略,以支持分层强化学习,使高层策略能够通过子目标向量指导智能体。该方法在复杂任务(如AntGather)上表现优异,通过对抗性目标生成学习到解耦的、具有空间意义的目标表征,优于非分层基线方法。
In hierarchical reinforcement learning a major challenge is determining appropriate low-level policies. We propose an unsupervised learning scheme, based on asymmetric self-play from Sukhbaatar et al. (2018), that automatically learns a good representation of sub-goals in the environment and a low-level policy that can execute them. A high-level policy can then direct the lower one by generating a sequence of continuous sub-goal vectors. We evaluate our model using Mazebase and Mujoco environments, including the challenging AntGather task. Visualizations of the sub-goal embeddings reveal a logical decomposition of tasks within the environment. Quantitatively, our approach obtains compelling performance gains over non-hierarchical approaches.
研究动机与目标
- 为解决在无显式监督的情况下,学习有效且通用的低层次策略与子目标表征的挑战。
- 使高层策略能够使用连续目标向量指导智能体,以捕捉可控制的环境动态。
- 通过无监督非对称自对弈预训练低层次策略,提升稀疏奖励任务中的样本效率与性能。
- 学习一个抽象掉无关环境细节但保留子目标可区分性与可实现性的目标嵌入空间。
提出的方法
- 使用非对称自对弈预训练低层次智能体(Bob),其中Bob通过目标向量生成并尝试解决自设任务。
- 采用目标条件策略网络,同时输入当前状态与目标向量,以引导低层次行为。
- 利用对抗性奖励结构,使第二个智能体(Alice)提出多样化且具挑战性的任务,防止策略崩溃并促进探索。
- 使用稀疏任务奖励训练高层策略(Charlie),每个动作对应50步时间窗及一连串目标向量。
- 在自对弈过程中使用基于距离的成功度量(D),聚焦于可控制的状态维度(如Ant中的x-y位置),忽略无关变量(如高度或关节角度)。
- 对目标提议策略应用熵正则化,以维持目标空间的多样性,避免退化解。
实验结果
研究问题
- RQ1无监督自对弈能否有效学习到支持多样化且可控制的低层次行为的通用连续目标嵌入空间?
- RQ2通过自对弈预训练如何提升分层强化学习在稀疏奖励环境中的样本效率与性能?
- RQ3所学习的目标嵌入空间在多大程度上反映了有意义的、解耦的且空间一致的子目标?
- RQ4高层策略能否通过组合学习到的子目标,泛化到复杂且长时程的任务中,即使仅使用稀疏的任务级奖励进行训练?
主要发现
- 所提模型在AntGather任务上实现了平均回报0.5,而PPO、REINFORCE和自对弈等非分层基线方法均未能学习到任何正向奖励。
- 目标嵌入的可视化显示其具有空间一致性,与实际提议目标的XY位置相匹配,表明有效学习了可控制的环境动态。
- Bob的策略泛化到未见过的目标向量时,覆盖的距离(超过6步)远超自对弈阶段(最大0.7步),证明了其强大的泛化能力。
- 随时间推移,提议目标的多样性持续提升,Alice学会在各个方向生成任务,熵正则化显著促进了这一过程。
- 固定目标向量的轨迹显示一致的朝向目标位置的运动,证实目标嵌入实现了精确控制。
- 目标嵌入空间抽象掉了无关的状态维度(如高度、关节角度),仅关注环境的可控制方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。