Skip to main content
QUICK REVIEW

[论文解读] Information is Power: Intrinsic Control via Information Capture

Nicholas Rhinehart, Jenny Wang|arXiv (Cornell University)|Dec 7, 2021
Reinforcement Learning in Robotics被引用 12
一句话总结

本文提出了一种名为基于信息捕获的内在控制(IC2)的深度强化学习框架,该框架利用潜在状态空间模型最小化智能体潜在状态访问的熵,从而在部分可观测环境中实现内在探索与控制。该方法使智能体能够仅通过视觉观察、无需外部奖励,即可发现、表征并控制动态物体(如移动的动物和天气变化),在无监督控制任务中达到专家水平的性能。

ABSTRACT

Humans and animals explore their environment and acquire useful skills even in the absence of clear goals, exhibiting intrinsic motivation. The study of intrinsic motivation in artificial agents is concerned with the following question: what is a good general-purpose objective for an agent? We study this question in dynamic partially-observed environments, and argue that a compact and general learning objective is to minimize the entropy of the agent's state visitation estimated using a latent state-space model. This objective induces an agent to both gather information about its environment, corresponding to reducing uncertainty, and to gain control over its environment, corresponding to reducing the unpredictability of future world states. We instantiate this approach as a deep reinforcement learning agent equipped with a deep variational Bayes filter. We find that our agent learns to discover, represent, and exercise control of dynamic objects in a variety of partially-observed environments sensed with visual observations without extrinsic reward.

研究动机与目标

  • 开发一种通用的内在奖励信号,使智能体能够在无外部奖励的情况下探索并控制动态的、部分可观测的环境。
  • 解决先前方法的局限性,这些方法要么避免交互(例如躲藏在稳定栖息地中),要么无法维持对可预测环境变化的控制。
  • 通过统一目标实现智能体既收集信息(减少不确定性)又实施控制(减少不可预测性)。
  • 形式化一种自监督学习目标,通过潜在状态表征同时捕捉信息收集与环境控制。
  • 证明最小化潜在访问熵可产生比先前内在动机方法更复杂、更鲁棒的行为。

提出的方法

  • 智能体采用深度变分贝叶斯滤波器,学习一个潜在状态空间模型(LSSM),以估计对环境隐藏状态的信念。
  • 内在奖励定义为智能体潜在状态访问分布的负熵,以鼓励信息收集与环境控制。
  • 通过强化学习训练策略,采用该熵最小化目标,以优化长期状态访问的可预测性。
  • 该方法将表征学习与控制目标相结合,其中LSSM对时间动态和从视觉观察中更新的信念进行建模。
  • 该方法与先前的探索方法正交,可与之结合以提高初始探索效率。
  • 该框架在具有动态元素(如移动动物和天气变化)的视觉复杂、部分可观测环境中进行了评估。

实验结果

研究问题

  • RQ1最小化潜在状态访问熵是否能在部分可观测环境中同时实现信息收集与环境控制?
  • RQ2与先前的内在动机方法(如新颖性探索或赋能最大化)相比,该目标在行为复杂性方面表现如何?
  • RQ3该方法是否能使智能体在无任何外部奖励的情况下发现并控制动态物体(如山羊或天气模式)?
  • RQ4智能体是否能学会构建稳定结构(如围栏、房屋)以随时间减少环境不确定性?
  • RQ5该方法在何种条件下会失效?在部署此类智能体于存在其他智能体或生命体的环境中时,需要何种保障措施?

主要发现

  • IC2智能体在视觉复杂、部分可观测的环境中,无需任何外部奖励,成功学习到对动态物体(如移动山羊和变化的天气)的发现、表征与控制。
  • 该方法在多个基准环境中达到了专家水平的性能,显著优于先前的无监督控制方法。
  • 与可能退化为躲藏或回避行为的先前方法不同,IC2主动寻求减少不确定性并维持对环境动态的控制。
  • 智能体表现出定位隐藏物体、建造围栏以稳定环境状态、以及建造庇护所以减少长期不可预测性的行为。
  • 该方法在捕捉和控制复杂环境因素方面,优于惊喜最小化和赋能最大化方法。
  • 该方法对部分可观测性具有鲁棒性,并能通过自监督学习使智能体学习到复杂、长时程的控制策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。