Skip to main content
QUICK REVIEW

[论文解读] A Boolean Task Algebra for Reinforcement Learning

Geraud Nangue Tasse, Steven James|arXiv (Cornell University)|Jan 6, 2020
Reinforcement Learning in Robotics参考文献 20被引用 12
一句话总结

本文提出了一种用于强化学习的布尔任务代数,通过析取、合取和否定操作实现任务的零样本组合。通过在基础任务上学习扩展的目标导向价值函数,智能体无需进一步训练即可最优地解决任何逻辑组合的任务,实现无额外样本的超指数级任务扩展。

ABSTRACT

The ability to compose learned skills to solve new tasks is an important property of lifelong-learning agents. In this work, we formalise the logical composition of tasks as a Boolean algebra. This allows us to formulate new tasks in terms of the negation, disjunction and conjunction of a set of base tasks. We then show that by learning goal-oriented value functions and restricting the transition dynamics of the tasks, an agent can solve these new tasks with no further learning. We prove that by composing these value functions in specific ways, we immediately recover the optimal policies for all tasks expressible under the Boolean algebra. We verify our approach in two domains---including a high-dimensional video game environment requiring function approximation---where an agent first learns a set of base skills, and then composes them to solve a super-exponential number of new tasks.

研究动机与目标

  • 使终身强化学习智能体能够组合已学习技能以解决新且复杂任务,而无需额外训练。
  • 使用布尔代数形式化任务组合,超越以往仅限于并集和交集的研究工作。
  • 提出一种利用扩展价值函数实现任务零样本组合的方法,该函数同时编码多个目标。
  • 在低维(Four Rooms)和高维(视频游戏)环境中通过函数逼近验证该方法。
  • 证明所有布尔组合任务的最优策略均可直接从基础价值函数推导得出。

提出的方法

  • 将任务形式化为布尔代数的元素,使用集合论语义定义任务上的逻辑运算(或、与、非)。
  • 引入扩展价值函数,同时编码多个目标的最优策略,以支持逻辑组合。
  • 证明布尔任务代数与价值函数代数之间存在同态关系,确保组合的正确性。
  • 限制转移动态以确保组合后的价值函数能直接产生新任务的最优策略,无需进一步学习。
  • 在高维环境中使用函数逼近,使该方法可扩展至真实强化学习场景。
  • 通过Four Rooms和视频游戏环境中的实验验证性能,测量组合任务上的平均回报。

实验结果

研究问题

  • RQ1能否以一种保持最优性的方式,形式化使用布尔运算符(或、与、非)组合任务?
  • RQ2智能体是否能在无需额外学习的情况下解决任何基于基础任务的布尔表达式表示的任务?
  • RQ3扩展价值函数的使用是否能实现最优策略的精确零样本组合?
  • RQ4该方法在需要函数逼近的高维环境中扩展性如何?
  • RQ5该框架能否应用于具有稀疏奖励和复杂状态空间的复杂现实环境?

主要发现

  • 所提出的布尔任务代数可实现任何基于基础任务布尔表达式的任务的零样本组合。
  • 通过组合扩展价值函数,智能体在无需进一步训练或学习的情况下,实现了所有组合任务的最优策略。
  • 在Four Rooms环境中,智能体在仅学习基础技能后,即以最优回报解决了所有布尔组合任务(包括或、与、异或)。
  • 在高维视频游戏环境中,智能体立即组合基础技能(收集蓝色物体、收集方形物体)以解决新任务,即使使用函数逼近也表现良好。
  • 该方法实现了任务能力的超指数级扩展——每个新增基础任务使可能的组合任务数量翻倍。
  • 该框架与底层价值函数学习算法无关,因此可与现代深度强化学习方法兼容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。