Skip to main content
QUICK REVIEW

[论文解读] Relative Variational Intrinsic Control

Kate Baumli, David Warde-Farley|arXiv (Cornell University)|Dec 14, 2020
Reinforcement Learning in Robotics被引用 6
一句话总结

本文提出了相对变分内在控制(RVIC),一种通过同时最大化从初始状态和最终状态预测技能的概率,同时最小化仅从最终状态预测技能的概率,来学习多样化、可泛化的技能的技能发现方法。RVIC使智能体能够学习到基于功能的技能,这些技能在状态空间中具有良好的泛化能力,在Atari和DeepMind Control Suite环境的分层强化学习设置中优于先前的方法。

ABSTRACT

In the absence of external rewards, agents can still learn useful behaviors by identifying and mastering a set of diverse skills within their environment. Existing skill learning methods use mutual information objectives to incentivize each skill to be diverse and distinguishable from the rest. However, if care is not taken to constrain the ways in which the skills are diverse, trivially diverse skill sets can arise. To ensure useful skill diversity, we propose a novel skill learning objective, Relative Variational Intrinsic Control (RVIC), which incentivizes learning skills that are distinguishable in how they change the agent's relationship to its environment. The resulting set of skills tiles the space of affordances available to the agent. We qualitatively analyze skill behaviors on multiple environments and show how RVIC skills are more useful than skills discovered by existing methods when used in hierarchical reinforcement learning.

研究动机与目标

  • 为了解决现有技能发现方法存在的局限性,即仅根据最终状态对状态空间进行划分,导致技能过于平凡地多样化。
  • 学习那些在改变智能体与环境关系方面具有多样性的技能,而不仅仅是关注其结束位置。
  • 为下游分层强化学习任务提供更具可组合性和可泛化性的技能。
  • 将技能多样性形式化为功能(即智能体与环境交互中浮现的动作可能性),而非基于最终状态的聚类。
  • 证明通过RVIC学习到的技能在分层强化学习设置中比VIC、DIAYN或VALOR更有效。

提出的方法

  • RVIC引入了双重逆向预测目标:一个从轨迹的初始状态和最终状态预测技能,另一个仅从最终状态预测技能。
  • 该方法通过变分互信息下界,最大化技能与(s₀, sₜ)之间的互信息,同时最小化技能与sₜ单独之间的互信息。
  • 这种双重目标确保技能能相对于初始状态具有可区分性,从而防止仅基于最终状态对状态空间进行平凡划分。
  • 通过结合双重逆向预测器,使用强化学习目标训练技能策略,以促进探索和技能多样性。
  • 该方法采用离散且均匀采样的技能先验,并使用固定长度的技能时段以稳定训练过程。
  • 该方法应用于Atari等基于像素的环境以及DeepMind Control Suite,展示了在无需显式状态表示的情况下学习技能的能力。

实验结果

研究问题

  • RQ1技能发现方法能否学习到在状态空间不同区域之间具有泛化能力的多样化技能,而非仅围绕特定最终状态聚集?
  • RQ2基于初始状态和最终状态的技能可区分性激励,是否能产生在分层强化学习中更具实用价值的技能?
  • RQ3基于相对状态转移(s₀, sₜ)而非仅基于最终状态的技能学习目标,能否产生类似功能的行为?
  • RQ4在基于像素的环境中,RVIC与VIC、DIAYN和VALOR相比,在技能质量及下游任务性能方面表现如何?
  • RQ5RVIC能否在不依赖显式状态表示或连续技能空间的情况下,学习到有意义且可迁移的技能?

主要发现

  • RVIC学习到的技能是基于其如何改变智能体与环境的关系而可区分的,而非仅基于轨迹结束时的位置。
  • 与VIC、DIAYN或VALOR相比,RVIC发现的技能具有更强的泛化能力和可组合性,因为它们依赖于初始状态和最终状态的联合信息。
  • 在分层强化学习中,RVIC技能在Atari环境中的样本效率更高,且性能优于基线方法。
  • RVIC成功地从原始像素中学习到类似功能的技能,适用于Atari和DeepMind Control Suite环境,证明了其在视觉观测空间中的适用性。
  • 该方法避免了仅基于最终状态对状态空间进行平凡划分的技能集合,而是学习到能跨不同初始状态泛化的技能。
  • 实证结果表明,RVIC技能在下游任务中能实现更好的迁移和规划能力,尤其是在跨多样化初始条件组合技能时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。