Skip to main content
QUICK REVIEW

[论文解读] Explore, Discover and Learn: Unsupervised Discovery of State-Covering Skills

Víctor Campos, Alexander T. Trott|arXiv (Cornell University)|Feb 10, 2020
Auction Theory and Applications被引用 22
一句话总结

该论文提出了一种名为探索、发现与学习(EDL)的新颖无监督技能发现方法,通过将技能发现与策略诱导的分布解耦,提升了状态空间的覆盖度。EDL 优化了与先前工作相同的基于信息论的目标,但采用固定的状态先验和变分推断,避免了过早收敛,从而在连续控制环境中实现了显著更优的覆盖度和鲁棒性,且对超参数的敏感度极低。

ABSTRACT

Acquiring abilities in the absence of a task-oriented reward function is at the frontier of reinforcement learning research. This problem has been studied through the lens of empowerment, which draws a connection between option discovery and information theory. Information-theoretic skill discovery methods have garnered much interest from the community, but little research has been conducted in understanding their limitations. Through theoretical analysis and empirical evidence, we show that existing algorithms suffer from a common limitation -- they discover options that provide a poor coverage of the state space. In light of this, we propose 'Explore, Discover and Learn' (EDL), an alternative approach to information-theoretic skill discovery. Crucially, EDL optimizes the same information-theoretic objective derived from the empowerment literature, but addresses the optimization problem using different machinery. We perform an extensive evaluation of skill discovery methods on controlled environments and show that EDL offers significant advantages, such as overcoming the coverage problem, reducing the dependence of learned skills on the initial state, and allowing the user to define a prior over which behaviors should be learned. Code is publicly available at https://github.com/victorcampos7/edl.

研究动机与目标

  • 解决现有基于信息论的技能发现方法中的关键局限:由于策略诱导的分布偏差导致的状态空间覆盖度差。
  • 开发一种方法,无需依赖任务特定奖励或初始策略偏差,即可发现多样化且覆盖状态空间的技能。
  • 使用户能够对有用行为定义先验,降低对初始状态分布的依赖。
  • 在保持与先前工作相同的基于赋能的信息论目标的同时,改善训练动态。
  • 证明更好的覆盖度可带来更有效的下游任务学习和元控制。

提出的方法

  • EDL 采用三阶段范式:使用随机策略探索环境,通过带有固定状态先验的变分推断框架发现技能,以及学习能最大化潜在码与状态之间互信息的选项。
  • 该方法使用潜在变量 z 和状态 s 之间互信息的变分下界,其中 p(s|z) 建模为高斯分布,而 p(z) 为用户定义的先验。
  • 通过固定 p(z) 并使用独立的探索阶段,EDL 避免了策略强化已发现状态的病态训练动态。
  • 技能发现阶段采用类似 VAE 的架构,学习一个潜在空间,使得每个 z 对应于覆盖状态空间中特定区域的技能。
  • EDL 的训练目标与赋能等价,但通过在状态上使用固定先验,避免了对策略诱导状态分布的依赖。
  • 该框架支持与现代技术(如状态边际匹配、向量量化和事后重标记)的集成,以提升可扩展性。

实验结果

研究问题

  • RQ1现有基于信息论的技能发现方法是否因策略诱导的分布偏差而导致状态空间覆盖度差?
  • RQ2对状态的固定先验是否能提升覆盖度并减少对初始策略行为的依赖?
  • RQ3将技能发现与策略动态解耦是否能产生更丰富多样的技能集合?
  • RQ4EDL 是否能在保持相同信息论目标的同时,实现更优的优化稳定性和覆盖度?
  • RQ5对行为的用户定义先验如何影响技能多样性及下游任务性能?

主要发现

  • EDL 在状态空间覆盖度方面显著优于现有方法,这在存在瓶颈状态的迷宫环境中得到验证,先前方法无法探索到初始可达状态之外的区域。
  • 该方法降低了对初始状态分布的敏感度,在不同起始位置下均表现出一致的技能发现能力。
  • EDL 允许用户对期望行为定义先验,从而实现对特定类型技能的定向发现。
  • 在受控环境中,EDL 发现了一个有意义且解耦的技能潜在空间,这些技能可组合生成复杂行为。
  • 实证结果表明,EDL 的训练动态避免了先前方法倾向于强化已发现状态而牺牲探索的病态倾向。
  • 即使使用相同的信息论目标,该方法在覆盖度和鲁棒性方面仍优于先前方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。