Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Subtask Discovery With Non-Negative Matrix Factorization

Adam Christopher Earle, Andrew Saxe|arXiv (Cornell University)|Aug 1, 2017
Machine Learning and Data Classification参考文献 15被引用 5
一句话总结

本文提出一种基于非负矩阵分解(NMF)的方法,通过利用多任务可解马尔可夫决策过程(MLMDP)框架,在强化学习中发现分层子任务。该方法发现低秩、非负的基任务,以表示状态空间中直观的、分布式的子目标,从而在无需预定义选项或单目标子任务的情况下,实现灵活的多层级分层规划。该方法可学习到定性上有意义的分解方式,适应任务集合,并可通过迭代实现更深层次的层次结构。

ABSTRACT

Hierarchical reinforcement learning methods offer a powerful means of planning flexible behavior in complicated domains. However, learning an appropriate hierarchical decomposition of a domain into subtasks remains a substantial challenge. We present a novel algorithm for subtask discovery, based on the recently introduced multitask linearly-solvable Markov decision process (MLMDP) framework. The MLMDP can perform never-before-seen tasks by representing them as a linear combination of a previously learned basis set of tasks. In this setting, the subtask discovery problem can naturally be posed as finding an optimal low-rank approximation of the set of tasks the agent will face in a domain. We use non-negative matrix factorization to discover this minimal basis set of tasks, and show that the technique learns intuitive decompositions in a variety of domains. Our method has several qualitatively desirable features: it is not limited to learning subtasks with single goal states, instead learning distributed patterns of preferred states; it learns qualitatively different hierarchical decompositions in the same domain depending on the ensemble of tasks the agent will face; and it may be straightforwardly iterated to obtain deeper hierarchical decompositions.

研究动机与目标

  • 为解决在复杂强化学习领域中自动发现有意义且可重用的子任务的挑战,而无需人工设计。
  • 通过学习一组最小化的子任务基,使分层强化学习能够扩展,以覆盖广泛可能的任务。
  • 开发一种方法,学习分布式的多状态子目标,而非单目标选项,以提高灵活性和迁移能力。
  • 允许对抽象进行迭代优化,以构建更深层次的分层结构,从而支持多层级规划。
  • 提供一个形式化且可分析处理的框架,用于比较子任务等价性并评估抽象质量。

提出的方法

  • 将子任务发现问题形式化为在多任务 LMDP 框架中寻找动作基的低秩逼近。
  • 应用非负矩阵分解(NMF)将任务矩阵分解为非负基矩阵 D 和系数矩阵 W,确保具有物理可解释性的、可加的子任务表示。
  • 利用 MLMDP 框架将任务建模为基任务的线性组合,通过指数化代价到目标函数实现最优策略组合。
  • 采用归一化近似误差度量来确定最优分解秩 k,通过“肘部关节”行为识别收益递减点。
  • 引入状态表示切换度量 g(s),以识别区域之间的边界状态(如门框),揭示其与传统子任务抽象的对偶性。
  • 基于基空间中的矩阵距离,定义子任务之间的伪等价关系,从而实现对不同子任务集合的正式比较。

实验结果

研究问题

  • RQ1非负矩阵分解能否有效从共享环境中一组多样化任务中发现最小且可解释的子任务基?
  • RQ2该方法的子任务发现如何适应不同任务集合?其结果抽象在定性上存在哪些差异?
  • RQ3该方法能否迭代应用以生成更深层次的分层结构?高层子任务与低层子任务在行为上存在何种差异?
  • RQ4给定领域中子任务的最优数量(秩 k)是多少?能否通过近似误差分析自动确定?
  • RQ5如何正式定义并度量子任务等价性?这为所学抽象结构提供了哪些洞见?

主要发现

  • 该方法发现的子任务具有直观性,表现为有意义的行为模式,如在网格世界中移动至不同房间或特定位置。
  • 在 TAXI 领域中,最优分解秩被确定为 k=5,对应于表示所有乘客位置配置所需的最小自由度数。
  • 归一化近似误差在 k=5 处表现出清晰的“肘部关节”行为,证实在此秩以上收益递减,验证了方法自动选择秩的合理性。
  • 在更深层次分层中学习到的子任务表现出更广泛、更分布式的状态覆盖范围,而低层子任务则呈现局部化、细粒度的行为,表明有效的分层抽象。
  • 该方法通过表示切换识别出门框作为边界状态,揭示了其与传统子任务发现方法(聚焦于此类过渡点)的自然对偶性。
  • 伪等价度量使子任务集合的正式比较成为可能,表明不同分解可产生等价或近似等价的行为抽象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。