Skip to main content
QUICK REVIEW

[论文解读] Autotelic Agents with Intrinsically Motivated Goal-Conditioned Reinforcement Learning: a Short Survey

Cédric Colas, Tristan Karch|arXiv (Cornell University)|Dec 17, 2020
Reinforcement Learning in Robotics被引用 8
一句话总结

本文提出了一种用于自激励智能体(autotelic agents)的框架——即能够内在驱动自身目标生成与学习的人工智能体——采用目标条件强化学习(RL)。通过将目标建模为紧凑表示与目标达成函数的组合,该方法使智能体能够自主探索、组合目标并泛化技能,推动人工智能领域开放式的终身学习发展。

ABSTRACT

Building autonomous machines that can explore open-ended environments, discover possible interactions and build repertoires of skills is a general objective of artificial intelligence. Developmental approaches argue that this can only be achieved by $autotelic$ $agents$: intrinsically motivated learning agents that can learn to represent, generate, select and solve their own problems. In recent years, the convergence of developmental approaches with deep reinforcement learning (RL) methods has been leading to the emergence of a new field: $developmental$ $reinforcement$ $learning$. Developmental RL is concerned with the use of deep RL algorithms to tackle a developmental problem -- the $intrinsically$ $motivated$ $acquisition$ $of$ $open$-$ended$ $repertoires$ $of$ $skills$. The self-generation of goals requires the learning of compact goal encodings as well as their associated goal-achievement functions. This raises new challenges compared to standard RL algorithms originally designed to tackle pre-defined sets of goals using external reward signals. The present paper introduces developmental RL and proposes a computational framework based on goal-conditioned RL to tackle the intrinsically motivated skills acquisition problem. It proceeds to present a typology of the various goal representations used in the literature, before reviewing existing methods to learn to represent and prioritize goals in autonomous systems. We finally close the paper by discussing some open challenges in the quest of intrinsically motivated skills acquisition.

研究动机与目标

  • 为解决在开放环境中使人工智能智能体能够自主生成、表示并追求自身目标的挑战。
  • 通过将内在动机与目标条件强化学习相结合,弥合发育机器人学与深度强化学习之间的鸿沟。
  • 开发一种计算框架,支持自生成、多样化且可组合的目标,以实现终身技能获取。
  • 识别并解决在目标表示、目标优先级排序以及技能泛化方面,对自主智能体的关键挑战。
  • 探讨社会文化环境如何塑造对人类与社会具有意义的目标表示。

提出的方法

  • 提出目标的一般定义:即由一个紧凑的目标表示与一个相关联的目标达成函数组成。
  • 对文献中现有的目标表示进行分类,包括基于状态、基于图像、基于语言以及基于累积量(cumulant-based)的目标。
  • 回顾利用目标条件强化学习学习目标表示的方法,包括逆向强化学习、目标嵌入网络以及生成模型。
  • 引入内在动机(例如预测误差、好奇心)以在缺乏外部奖励的情况下引导目标选择与探索。
  • 应用分层强化学习与选项(option-based)RL,以实现跨目标的技能组合与迁移。
  • 提出智能体可通过累积量的线性组合或离散目标元素的组合来学习目标组合,从而实现对新任务的泛化。

实验结果

研究问题

  • RQ1人工智能智能体如何在无外部监督的情况下自主生成并表示自身目标?
  • RQ2何种类型的目标表示能够在开放环境中实现有效的探索与泛化?
  • RQ3如何形式化内在动机,以在缺乏外部奖励的情况下引导目标选择与学习?
  • RQ4智能体可通过何种方式组合现有技能或目标,以形成新的复杂行为?
  • RQ5社会文化环境如何塑造目标表示,使其与人类价值观和社会相关性相一致?

主要发现

  • 目标条件强化学习可被重新诠释为内在激励、自主学习的核心机制,即使在最初并非为此目的设计的模型中亦然。
  • 将内在动机与目标条件强化学习相结合,可使智能体探索多样化且非平凡的行为,并构建开放式的技能组合。
  • 基于语言和离散的目标表示支持组合泛化,使智能体能够组合已知目标以形成新的复杂指令。
  • 通过选项框架实现的基于累积量的目标表示,使智能体能够泛化至任何已知行为的线性组合,从而实现灵活的技能迁移。
  • 尽管已取得进展,当前框架中对并发技能组合与长时程目标达成的探索仍显不足。
  • 社会文化环境对于将目标表示扎根于人类有意义的概念至关重要,提示了一条实现社会对齐人工智能的可行路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。