Skip to main content
QUICK REVIEW

[论文解读] Language as an Abstraction for Hierarchical Deep Reinforcement Learning

Yiding Jiang, Shixiang Gu|arXiv (Cornell University)|Jun 18, 2019
Reinforcement Learning in Robotics参考文献 65被引用 65
一句话总结

论文提出 HAL,一种在分层强化学习中使用语言作为高层与低层策略之间抽象的框架,使低层策略具备可组合、遵循指令的能力,而高层策略在语言空间中操作。它在受 MuJoCo-CLEVR 启发的环境中进行验证,显示相比非组合抽象和基线在学习、泛化和可扩展性方面的改进。

ABSTRACT

Solving complex, temporally-extended tasks is a long-standing problem in reinforcement learning (RL). We hypothesize that one critical element of solving such problems is the notion of compositionality. With the ability to learn concepts and sub-skills that can be composed to solve longer tasks, i.e. hierarchical RL, we can acquire temporally-extended behaviors. However, acquiring effective yet general abstractions for hierarchical RL is remarkably challenging. In this paper, we propose to use language as the abstraction, as it provides unique compositional structure, enabling fast learning and combinatorial generalization, while retaining tremendous flexibility, making it suitable for a variety of problems. Our approach learns an instruction-following low-level policy and a high-level policy that can reuse abstractions across tasks, in essence, permitting agents to reason using structured language. To study compositional task learning, we introduce an open-source object interaction environment built using the MuJoCo physics engine and the CLEVR engine. We find that, using our approach, agents can learn to solve to diverse, temporally-extended tasks such as object sorting and multi-object rearrangement, including from raw pixel observations. Our analysis reveals that the compositional nature of language is critical for learning diverse sub-skills and systematically generalizing to new sub-skills in comparison to non-compositional abstractions that use the same supervision.

研究动机与目标

  • 为层次化强化学习提供一种以语言作为可组合抽象的动机与应用,以实现长时技能学习。
  • 开发一个两层的 HAL 框架,其中高层策略输出语言指令给低层、遵循指令的策略执行。
  • 创建一个将 MuJoCo 物理与 CLEVR 启发的语言结合的开源环境,用于对象操作任务以研究组合泛化。
  • 证明以语言为抽象的表示在泛化性和效率方面优于非组合方法和标准 HRL 基线。

提出的方法

  • 引入 HAL(Hierarchical Abstraction with Language),这是一个两层的 HRL,其中高层策略输出语言指令 g,低层策略在给定 s 与 g 的条件下执行动作。
  • 用来自指令-关系函数 Psi(s, g) 的监督以及一个称为“事后指令重标注”(HIR)的重标注策略来训练以语言为条件的低层策略,以稠密化奖励。
  • 通过将轨迹片段与来自环境 Omega(s) 分布的语言目标关联来进行重标注,从而使学习能够从多语言目标中获益。
  • 训练高层策略以从 G 的结构化子集 I 中选择语言指令 g,实质上将问题转化为在指令词汇表上的离散动作强化学习。
  • 采用两层训练机制,在低层策略以语言作为目标条件进行训练的同时,高层策略学习编排指令以实现长时任务。
  • 将 HAL 与 DDQN、HIRO 和 Option-Critic 在基于视觉的长时任务上进行对比,并展示对图像观测的迁移能力。

实验结果

研究问题

  • RQ1语言作为抽象表示相较于非组合表示在 HRL 的指令遵循方面有何差异?
  • RQ2高层策略能否有效地将一系列语言指令组合起来以解决长时任务?
  • RQ3语言的组合结构是否能实现对训练中未见过的指令和设置的系统性泛化?
  • RQ4HAL 针对基于视觉的观测和更丰富的任务集能否实现扩展?
  • RQ5与标准 HRL 基线相比,HAL 在长时操控任务上的表现如何?

主要发现

  • 基于语言的抽象在学习和泛化方面相对于非组合表示和单热编码指令具有显著提升,尤其当指令集规模扩大时。
  • 事后指令重标注显著增加了低层策略的学习信号,对于有效的指令遵循学习至关重要。
  • HAL 能在高层任务稀疏奖励的情况下学习解决多项任务,并且从状态观测到像素观测的迁移表现优于 DDQN、HIRO 和 Option-Critic,在标准任务上具有高稳定性和较低方差。
  • 在基于视觉的设置中,HAL 维持了性能和样本效率,而基线方法往往难以学习。
  • 组合语言实现了系统性泛化,语言展现出较小的泛化差距,以及对训练中未见过的指令的零样本泛化能力(相较于非组合基线而言)。
  • 环境与代码(HAL 演示)是开源的,并包含受到 CLEVR 启发的连续控制任务,用于研究组合性、长时操作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。