[论文解读] Disentangled Skill Embeddings for Reinforcement Learning
本文提出解耦技能嵌入(DSE),一种基于变分推断的多任务强化学习框架,通过为动力学和目标分别学习独立的潜在嵌入,实现对未见过组合的快速泛化。该方法在层级强化学习设置中实现了优越的迁移性能与快速微调性能,在MuJoCo任务(如Reacher和CartPole)上优于单嵌入和独立基线方法。
We propose a novel framework for multi-task reinforcement learning (MTRL). Using a variational inference formulation, we learn policies that generalize across both changing dynamics and goals. The resulting policies are parametrized by shared parameters that allow for transfer between different dynamics and goal conditions, and by task-specific latent-space embeddings that allow for specialization to particular tasks. We show how the latent-spaces enable generalization to unseen dynamics and goals conditions. Additionally, policies equipped with such embeddings serve as a space of skills (or options) for hierarchical reinforcement learning. Since we can change task dynamics and goals independently, we name our framework Disentangled Skill Embeddings (DSE).
研究动机与目标
- 解决多任务强化学习中在任务动力学和奖励函数变化时策略泛化的问题。
- 克服先前方法中潜在空间纠缠导致的泛化能力受限问题,难以推广到未见的任务组合。
- 通过学习解耦的、任务特定的动力学与目标潜在嵌入,实现高效的迁移与快速微调。
- 通过提供一个可重用的、解耦的技能空间,促进层级强化学习中高层策略的学习。
- 通过零样本和少样本微调场景,展示对未见动力学与目标条件的泛化能力。
提出的方法
- 将多任务强化学习建模为一个变分推断问题,共享策略参数,并引入两个解耦的潜在变量:一个用于动力学(z),一个用于目标(g)。
- 使用变分后验分布 qϕ(π|z,g) 参数化策略,其中 z 和 g 从任务特定的分布中独立采样。
- 通过最大化期望回报并最小化后验与先验分布之间KL散度的变分目标进行训练。
- 实现两种算法:DSE-REINFORCE(用于在线策略学习)和 DSE-SAC(用于离线策略、软 actor-critic 风格的学习)。
- 解耦潜在空间,使得动力学或目标的变化可独立控制,从而支持插值与零样本泛化。
- 通过将目标嵌入空间用作高层策略的离散动作空间,并将DSE策略作为低层选项,实现层级强化学习。
实验结果
研究问题
- RQ1对动力学和目标的解耦潜在表征是否能提升多任务强化学习中的泛化能力?
- RQ2在快速微调后,具有解耦嵌入的策略在未见的动力学与目标组合上泛化能力如何?
- RQ3解耦技能空间在层级强化学习中对样本效率的提升程度如何?
- RQ4在多任务和少样本设置中,解耦结构是否优于纠缠或单嵌入基线方法?
- RQ5所学习的嵌入是否能有效支持在未见目标轨迹场景下的高层策略学习?
主要发现
- 在Reacher-v2环境中,DSE-SAC在未见测试任务上的平均回合奖励为 -21.96 ± 2.20,优于单嵌入SAC的 -24.29 ± 1.50。
- 单任务策略需要 43.22 ± 2.16 条轨迹才能达到DSE-SAC的初始性能,表明其具备更快的适应能力。
- DSE-SAC在CartPole和Reacher上的插值实验中,有效泛化到未见的动力学与目标组合。
- 在层级强化学习中,使用DSE-SAC作为低层策略的H-SAC在解决连续目标跟踪任务时,比在低层动作上训练的标准SAC更快收敛。
- DSE-REINFORCE在CartPole上表现优异,而DSE-SAC在Reacher上优于DSE-REINFORCE,表明在复杂环境中具有更高的样本效率。
- 解耦结构实现了对动力学和目标条件的独立控制,支持有效的插值与零样本策略迁移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。