Skip to main content
QUICK REVIEW

[论文解读] Shaping Belief States with Generative Environment Models for RL

Karol Gregor, Danilo Jimenez Rezende|arXiv (Cornell University)|Jun 21, 2019
Reinforcement Learning in Robotics参考文献 56被引用 16
一句话总结

本文提出使用具有预测建模和超前预测(overshooting)能力的表达性生成环境模型,从第一人称观测中学习复杂3D环境中稳定、长期的信念状态。通过在策略网络与生成模型之间共享这些信念状态,该方法在不牺牲训练速度的前提下,显著提升了强化学习的数据效率。

ABSTRACT

When agents interact with a complex environment, they must form and maintain beliefs about the relevant aspects of that environment. We propose a way to efficiently train expressive generative models in complex environments. We show that a predictive algorithm with an expressive generative model can form stable belief-states in visually rich and dynamic 3D environments. More precisely, we show that the learned representation captures the layout of the environment as well as the position and orientation of the agent. Our experiments show that the model substantially improves data-efficiency on a number of reinforcement learning (RL) tasks compared with strong model-free baseline agents. We find that predicting multiple steps into the future (overshooting), in combination with an expressive generative model, is critical for stable representations to emerge. In practice, using expressive generative models in RL is computationally expensive and we propose a scheme to reduce this computational burden, allowing us to build agents that are competitive with model-free baselines.

研究动机与目标

  • 开发一种方法,通过自监督生成建模,在部分可观测、视觉丰富的3D环境中学习稳定、长期的信念状态。
  • 通过引入超前预测和表达性架构,解决生成模型中长期预测的不稳定性问题。
  • 通过在策略模型与生成模型之间共享信念状态,提升强化学习中的数据效率。
  • 证明基于表达性生成模型的预测建模可使智能体学会在3D环境中构建结构等复杂行为。

提出的方法

  • 智能体使用循环神经网络(RNN)从第一人称视觉观测和动作中维持信念状态。
  • 一个独立的仿真网络(SimCore)通过在环境中滚动执行动作而不依赖新观测,预测未来状态。
  • 生成模型从模拟的信念状态重建未来帧,采用多步超前预测的目标函数。
  • 信念状态在策略网络与生成模型之间共享,实现联合训练并提升数据效率。
  • 评估了三种信念状态架构:标准LSTM、带Kanerva记忆的LSTM,以及基于槽(slot-based)记忆的LSTM。
  • 模型通过对比损失和预测目标进行训练,以促进全局一致性与长期一致性。

实验结果

研究问题

  • RQ1通过预测目标训练的表达性生成模型是否能在视觉复杂的3D环境中形成稳定、长期的信念状态?
  • RQ2多步预测中的超前预测如何提升所学表征的稳定性和一致性?
  • RQ3在强化学习中,策略与生成模型之间共享信念状态在多大程度上提升了数据效率?
  • RQ4此类系统是否能使智能体学会在3D环境中执行复杂、长时程的行为,如构建结构?

主要发现

  • 表达性生成模型与超前预测的结合,能够生成稳定且一致的信念状态,准确捕捉环境的全局结构与智能体的位置。
  • 与强大的无模型基线相比,通过与生成模型共享信念状态的智能体在多个强化学习任务中实现了显著更高的数据效率。
  • SimCore组件通过仅使用动作模拟未来状态,提升了性能并降低了对超参数和滚动长度的敏感性。
  • 该模型成功使智能体学会在基于体素的环境中建造楼梯和塔楼,以抵达高处或跨越间隙的食物方块。
  • 尽管Kanerva记忆提升了解码性能,但在强化学习训练设置中表现出不稳定性,表明记忆架构仍需进一步研究。
  • 该方法使首个能够从第一人称视角在3D环境中学习收集材料并构建复杂结构的智能体成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。