[论文解读] CompILE: Compositional Imitation Learning and Execution
CompILE 提出了一种完全可微、无监督的框架,通过软序列分割联合发现任务边界和潜在编码,从演示数据中学习组合性、可变长度的行为片段。该方法使层次强化学习智能体能够利用学习到的子策略泛化到更长的序列和未见过的环境,在稀疏奖励设置下显著提升样本效率,而传统非层次智能体则会失败。
We introduce Compositional Imitation Learning and Execution (CompILE): a framework for learning reusable, variable-length segments of hierarchically-structured behavior from demonstration data. CompILE uses a novel unsupervised, fully-differentiable sequence segmentation module to learn latent encodings of sequential data that can be re-composed and executed to perform new tasks. Once trained, our model generalizes to sequences of longer length and from environment instances not seen during training. We evaluate CompILE in a challenging 2D multi-task environment and a continuous control task, and show that it can find correct task boundaries and event encodings in an unsupervised manner. Latent codes and associated behavior policies discovered by CompILE can be used by a hierarchical agent, where the high-level policy selects actions in the latent code space, and the low-level, task-specific policies are simply the learned decoders. We found that our CompILE-based agent could learn given only sparse rewards, where agents without task-specific policies struggle.
研究动机与目标
- 在无任务标注的情况下,从序列演示数据中发现组合性、层次化结构。
- 学习可重用、可变长度的行为片段,可重新组合形成新行为。
- 使层次强化学习智能体能够利用学习到的子策略解决稀疏奖励任务。
- 开发一种完全可微、无监督的分割机制,联合识别事件边界和潜在编码。
- 展示对更长序列和未见环境或任务组合的泛化能力。
提出的方法
- CompILE 使用条件变分自编码器(VAE)结合软片段掩码,通过依次关注并编码可变长度片段来重建状态-动作轨迹。
- 利用 Gumbel-Softmax 重参数化技巧,将片段边界建模为松弛的离散潜在变量,以实现可微训练。
- 每个片段被编码为潜在码,解码器通过执行学习到的潜在码序列来重建原始轨迹。
- 推理时,软掩码被替换为离散的、连续的掩码,以通过迭代分割处理任意长度的序列。
- 该框架支持层次智能体,其中高层策略选择潜在码,低层策略为学习到的解码器。
- 通过端到端的自编码目标进行训练,以鼓励对专家演示的精确重建。
实验结果
研究问题
- RQ1无监督模型能否在无任务标注的情况下,从原始状态-动作轨迹中发现有意义且可重用的行为子程序?
- RQ2学习到的片段边界和潜在码能否泛化到更长的序列和未见环境?
- RQ3所发现的子策略能否使层次智能体解决非层次智能体失败的稀疏奖励任务?
- RQ4可微分割模块在识别事件边界和编码任务特定行为方面的有效性如何?
- RQ5在无监督条件下,潜在码在多大程度上能与语义任务结构对齐?
主要发现
- 基于 CompILE 的层次智能体成功学习解决了多任务网格世界环境中的所有稀疏奖励任务,而基线非层次智能体则全部失败。
- 尽管仅在三任务演示上进行训练,该模型仍成功泛化到五任务配置,展现出强大的组合泛化能力。
- 在稀疏奖励设置下,层次智能体在不同随机种子下均表现出一致的学习性能,而低层基线仅在提供密集子任务奖励时才有效。
- 该模型以无监督方式发现了可靠的的任务边界和有效的潜在编码,即使在具有位置特异性语义而非对象特异性语义的环境中也成立。
- 学习曲线的指数平滑显示,基于 CompILE 的智能体表现出稳定且一致的性能提升,而基线在稀疏奖励下无学习信号。
- 该框架显著提升了复杂控制任务中层次决策的探索效率和信用分配能力,大幅提高了样本效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。