Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning with Structured Hierarchical Grammar Representations of Actions

Petros Christodoulou, Robert Tjarko Lange|arXiv (Cornell University)|Oct 7, 2019
Reinforcement Learning in Robotics参考文献 19被引用 4
一句话总结

本文提出动作语法强化学习(AG-RL),一种利用语法推断从智能体行为中发现分层宏动作的框架,从而提升深度强化学习的样本效率。通过在动作空间中引入这些学习到的宏动作,AG-RL在20款Atari游戏中均提升了性能,相较于SAC模型,样本效率中位数提升+96%,最高提升达+3,756%,且在17款游戏中优于最先进方法,且无需大量超参数调优。

ABSTRACT

From a young age humans learn to use grammatical principles to hierarchically combine words into sentences. Action grammars is the parallel idea, that there is an underlying set of rules (a "grammar") that govern how we hierarchically combine actions to form new, more complex actions. We introduce the Action Grammar Reinforcement Learning (AG-RL) framework which leverages the concept of action grammars to consistently improve the sample efficiency of Reinforcement Learning agents. AG-RL works by using a grammar inference algorithm to infer the "action grammar" of an agent midway through training. The agent's action space is then augmented with macro-actions identified by the grammar. We apply this framework to Double Deep Q-Learning (AG-DDQN) and a discrete action version of Soft Actor-Critic (AG-SAC) and find that it improves performance in 8 out of 8 tested Atari games (median +31%, max +668%) and 19 out of 20 tested Atari games (median +96%, maximum +3,756%) respectively without substantive hyperparameter tuning. We also show that AG-SAC beats the model-free state-of-the-art for sample efficiency in 17 out of the 20 tested Atari games (median +62%, maximum +13,140%), again without substantive hyperparameter tuning.

研究动机与目标

  • 解决深度强化学习中样本效率低下,尤其是在稀疏奖励环境下的关键挑战。
  • 利用语言语法规律与动作层次结构之间的生物与认知类比,提升学习效率与可解释性。
  • 开发一种方法,在训练过程中自动发现并整合结构化、分层的宏动作到智能体的动作空间中。
  • 证明语法引导的宏动作可显著提升在多样化Atari环境中的性能,且无需大量超参数调优。
  • 引入通用技术——事后动作重播(Hindsight Action Replay)与弃船策略(Abandon Ship),以增强使用长宏动作时的训练稳定性和数据效率。

提出的方法

  • 在固定步数后暂停训练,收集智能体的动作序列,并应用语法推断算法识别重复出现的结构化动作模式。
  • 将识别出的动作序列转化为宏动作(时间抽象),代表更高阶的行为,有效将原始动作组合为复杂且可重用的单元。
  • 在智能体原始动作空间中加入这些发现的宏动作,使其在继续训练期间可选择使用。
  • 使用事后动作重播(HAR)提升数据效率,即使原始目标未达成,也能重用宏动作的经验。
  • 实施弃船策略以减少宏动作训练过程中的方差,若宏动作失败则允许其提前终止,从而提升学习稳定性。
  • 将该框架应用于DDQN与SAC智能体(AG-DDQN与AG-SAC),采用迁移学习微调网络,而非从头训练。

实验结果

研究问题

  • RQ1从智能体行为中发现的分层动作语法能否提升深度强化学习的样本效率?
  • RQ2与手工设计或重复原始动作相比,语法推断的宏动作在性能与环境泛化能力方面表现如何?
  • RQ3所提出的两种技术——事后动作重播与弃船策略——在使用长宏动作训练时,能在多大程度上提升学习稳定性和数据效率?
  • RQ4AG-RL框架是否能在多样化Atari游戏中持续优于标准强化学习智能体与最先进方法,在样本效率方面表现更优?
  • RQ5该框架是否能有效应用于基于值函数(DDQN)与基于策略(SAC)的强化学习算法,且无需大量超参数调优?

主要发现

  • AG-RL在使用AG-DDQN的8款测试Atari游戏中均提升了性能,相较于DDQN,样本效率中位数提升+31%,最高提升达+668%。
  • AG-SAC在20款Atari游戏中的19款中,相较于SAC,样本效率中位数提升+96%,最高提升达+3,756%,且超参数调优极少。
  • AG-SAC在20款Atari游戏中的17款中,样本效率优于无模型最先进方法,中位数提升+62%,最高提升达+13,140%。
  • 弃船策略显著降低了训练方差,使得长度超过100个时间步的宏动作也能实现有效学习。
  • 事后动作重播对性能至关重要,若移除该技术,AG-DDQN的性能将与标准DDQN无异,表明其在最大化经验重用中的关键作用。
  • 平均而言,智能体在评估阶段执行的宏动作长度为6.9(而仅使用原始动作时为1.0),表明广泛使用了高层动作,宏动作长度范围从2到超过100个时间步不等。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。