Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Reinforcement Learning for Sequencing Behaviors

Hadi Salman, Jaskaran Grover|arXiv (Cornell University)|Mar 5, 2018
Robot Manipulation and Learning参考文献 6被引用 19
一句话总结

该论文提出了一种分层强化学习框架,通过视觉输入联合学习机器人导航技能并对其进行排序,利用深度神经网络实现跨环境的泛化。该方法通过从原始观测端到端学习策略和状态表示,超越了传统规划方法,实现了无需手工设计启发式规则的鲁棒导航。

ABSTRACT

Recent literature in the robot learning community has focused on learning robot skills that abstract out lower-level details of robot control, such as Dynamic Movement Primitives (DMPs), the options framework in hierarchical RL, and subtask policies. To fully leverage the efficacy of these macro actions, it is necessary to then sequence these primitives to achieve a given task. Our objective is to jointly learn a set of robot skills and a sequence of these learnt skills to accomplish a given task. We consider the task of navigating a robot across various environments using visual input, maximizing the distance traveled through the environment while avoiding static obstacles. Traditional planning methods to solve this problem rely on hand-crafted state representations and heuristics for planning, and often fail to generalize. In contrast, deep neural networks have proved to be powerful function approximators, successfully modeling complex control policies. In addition, the ability of such networks to learn good representations of high-dimensional sensory inputs makes them a valuable tool when dealing with visual inputs. In this project, we explore the capability of deep neural networks to learn and sequence robot skills for navigation, directly using visual input.

研究动机与目标

  • 解决在具有静态障碍物的多样化环境中实现机器人导航泛化的问题。
  • 克服传统规划方法依赖手工设计状态表示和启发式规则的局限性。
  • 实现基于视觉输入的机器人技能及其序列的端到端学习。
  • 利用深度神经网络从高维感官数据中学习有效的状态表示和控制策略。
  • 通过联合训练技能策略及其排序策略,实现鲁棒的导航性能。

提出的方法

  • 采用分层强化学习将导航任务分解为宏观动作(技能)和高层级策略以编排这些技能。
  • 使用深度神经网络将原始视觉输入直接映射到策略输出,消除对手工设计特征的需求。
  • 通过强化学习训练系统,以最大化累计行进距离并避免障碍物。
  • 在联合优化框架中同时学习低层技能策略和高层级排序策略。
  • 通过深度网络的函数逼近来建模视觉输入与控制策略之间复杂的非线性关系。
  • 应用策略梯度方法,以视觉观测为输入,优化分层策略结构。

实验结果

研究问题

  • RQ1分层强化学习框架能否在无需手工工程特征的情况下,直接从视觉输入中学习有效的导航技能?
  • RQ2联合训练的技能与排序策略在具有静态障碍物的多样化环境中泛化能力如何?
  • RQ3从原始视觉数据中端到端学习策略与表示是否优于依赖手工启发式规则的传统规划方法?
  • RQ4深度神经网络在多大程度上能学习到支持长时程导航任务的有意义状态表示?
  • RQ5与平坦的强化学习方法相比,分层结构是否能提升样本效率和任务性能?

主要发现

  • 所提出的分层强化学习框架能够直接从视觉输入中学习导航策略,在多样化环境中表现出鲁棒性能。
  • 该方法在泛化能力上优于依赖手工设计状态表示和启发式规则的传统规划方法。
  • 深度神经网络能有效从原始视觉观测中学习技能策略及其排序策略。
  • 技能与排序策略的联合训练使系统能够在避免障碍物的同时实现更长距离的导航。
  • 由于深度网络的表示学习能力,该方法在未见过的环境中表现出更强的适应性。
  • 与基线方法相比,该系统实现了更高的累计行进距离,表明其具备有效的技能编排能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。