[论文解读] Learning to Compose Skills
本文提出 ComposeNet,一种可微分框架,通过技能状态嵌入和可训练的组合函数,学习组合预训练技能,实现基于线性时序逻辑(LTL)规范的复杂任务高效学习。该方法实现了对未见过的技能组合的零样本泛化,并在技能主干的端到端训练或微调方法上表现更优。
We present a differentiable framework capable of learning a wide variety of compositions of simple policies that we call skills. By recursively composing skills with themselves, we can create hierarchies that display complex behavior. Skill networks are trained to generate skill-state embeddings that are provided as inputs to a trainable composition function, which in turn outputs a policy for the overall task. Our experiments on an environment consisting of multiple collect and evade tasks show that this architecture is able to quickly build complex skills from simpler ones. Furthermore, the learned composition function displays some transfer to unseen combinations of skills, allowing for zero-shot generalizations.
研究动机与目标
- 为解决传统层级强化学习在灵活且高效地组合技能方面的局限性。
- 通过可微分组合函数实现对未见技能组合的零样本泛化。
- 通过复用多个组合任务中的预训练技能策略,降低样本复杂度。
- 证明技能状态嵌入编码了足够的任务相关信息,以支持有效组合。
- 展示递归组合可实现复杂行为的层次化学习。
提出的方法
- 使用专用架构训练技能策略,输出技能状态嵌入,通过单个可微分层捕获状态相关的策略信息。
- 组合函数将多个技能的嵌入作为输入,输出组合任务的策略,通过策略梯度端到端训练。
- 任务通过线性时序逻辑(LTL)指定,支持表达性强且语义明确的组合,如“在躲避 B 的同时收集 A”或“先收集 A 再收集 B”。
- 该框架支持递归组合,允许从简单技能构建层次化技能结构。
- 消融实验验证了技能状态嵌入和组合层的必要性,表明当任一组件被移除或替换时性能显著下降。
- 组合函数使用策略梯度方法训练,目标是最大化组合环境中累积折扣奖励。
实验结果
研究问题
- RQ1可微分组合函数能否在不重新训练的情况下有效组合预训练技能策略以解决复杂任务?
- RQ2该框架是否能泛化到未见过的技能组合,实现零样本学习?
- RQ3技能状态嵌入与原始策略权重相比,在支持可训练组合方面表现如何?
- RQ4技能的递归组合能否生成用于日益复杂任务的层次化行为?
- RQ5在组合函数中使用错误或无关技能会产生何种影响?
主要发现
- 当正确组合技能时,组合函数性能最高;当使用错误或无关技能时,性能显著下降。
- 组合“收集红色”和“躲避绿色”技能在“在躲避绿色的同时收集红色”任务中表现最佳,而使用“收集绿色”和“躲避红色”技能虽仍获得正向奖励但明显更低。
- 使用两个无关技能(如“收集蓝色”和“躲避蓝色”)会导致无法学习,表明嵌入必须编码任务相关的信息。
- 在单一技能主干上微调新策略层的性能劣于 ComposeNet,尤其在需要多技能协调的任务中表现更差。
- 在“先收集红色再收集绿色”任务中,微调单一技能主干无法学习正确顺序,而 ComposeNet 成功学习了所需顺序。
- 组合函数可泛化到未见过的任务,展现出零样本能力,并且仅用少量环境样本即可快速收敛。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。