Skip to main content
QUICK REVIEW

[论文解读] Autonomous Extracting a Hierarchical Structure of Tasks in Reinforcement Learning and Multi-task Reinforcement Learning

Behzad Ghazanfari, Matthew E. Taylor|arXiv (Cornell University)|Sep 14, 2017
Reinforcement Learning in Robotics参考文献 16被引用 13
一句话总结

该论文提出了一种名为ARM-HSTRL的新方法,通过将关联规则挖掘(ARM)应用于智能体轨迹,自主提取强化学习(RL)及多任务RL中的层次化任务结构。通过识别频繁访问的子目标及其顺序关系,ARM-HSTRL在无需环境动态或分解MDP结构先验知识的情况下构建任务层次结构,显著提升了学习效率,并实现了在具有不同转移和奖励函数的多样化任务间稳健的知识迁移。

ABSTRACT

Reinforcement learning (RL), while often powerful, can suffer from slow learning speeds, particularly in high dimensional spaces. The autonomous decomposition of tasks and use of hierarchical methods hold the potential to significantly speed up learning in such domains. This paper proposes a novel practical method that can autonomously decompose tasks, by leveraging association rule mining, which discovers hidden relationship among entities in data mining. We introduce a novel method called ARM-HSTRL (Association Rule Mining to extract Hierarchical Structure of Tasks in Reinforcement Learning). It extracts temporal and structural relationships of sub-goals in RL, and multi-task RL. In particular,it finds sub-goals and relationship among them. It is shown the significant efficiency and performance of the proposed method in two main topics of RL.

研究动机与目标

  • 解决因维度灾难导致的高维强化学习环境中学习速度缓慢的问题。
  • 实现在无需专家提供层次结构的情况下,自动将任务分解为有意义的子目标及其结构关系。
  • 通过从原始轨迹中发现特定任务的层次结构,提升多任务强化学习(MTRL)中的样本效率与知识迁移能力。
  • 开发一种实用且可扩展的方法,无需动作模型、分解MDP假设或轨迹预处理。
  • 证明通过ARM提取的层次结构在复杂RL设置中可实现比标准Q-learning更快的收敛速度和更优性能。

提出的方法

  • 该方法将关联规则挖掘(ARM)应用于强化学习训练期间收集的状态轨迹,以发现频繁出现的状态序列。
  • 利用ARM的“频繁项集生成”阶段,识别在成功轨迹中频繁出现的状态作为子目标。
  • 利用ARM的“规则生成”阶段,提取子目标之间的顺序关系,表示为“若子目标A,则子目标B”的蕴含规则形式。
  • 通过将这些关联规则组合成树状层次结构,构建任务的子目标及其依赖关系的层次结构。
  • 该方法在单任务RL与多任务RL中均适用,可基于任务间的结构相似性实现部分策略共享。
  • 该方法无需环境转移或奖励函数的先验知识,也不依赖分解MDP表示或轨迹清洗。

实验结果

研究问题

  • RQ1关联规则挖掘能否有效用于从原始RL轨迹中发现子目标及其顺序关系?
  • RQ2所提取的层次结构能否显著提升强化学习中的学习速度与样本效率?
  • RQ3在具有不同转移与奖励函数的多任务RL设置中,该方法表现如何?
  • RQ4该方法能否自主识别并处理任务间的结构差异,以实现有效的知识迁移?
  • RQ5基于ARM提取的层次结构,是否比迁移学习中的值函数共享更具鲁棒性与泛化能力?

主要发现

  • ARM-HSTRL在学习速度方面显著优于标准Q-learning,在多个实验中大幅减少了达到目标所需的步数。
  • 在单任务RL中,ARM-HSTRL相比Q-learning实现了更快的收敛速度与更高的累积奖励,如图7–10所示。
  • 在多任务RL中,ARM-HSTRL成功学习并区分了具有不同转移与奖励函数的多个任务,而Q-learning在相同条件下未能收敛。
  • 在第二个测试平台的实验3中(图6),该方法表现出稳健性能,各任务具有不同的动力学特性,ARM-HSTRL保持了稳定的学习进展与奖励积累(图11–12)。
  • 通过ARM提取的层次结构实现了有效的任务特定策略学习,并能根据结构相似性动态组合或分离学习过程,显著提升了可迁移性。
  • 该方法在理论上与实证上均表明可导出层次最优策略,且相比值函数迁移更具鲁棒性,尤其在源域与目标域动力学差异较大时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。