Skip to main content
QUICK REVIEW

[论文解读] Generative Temporal Models with Spatial Memory for Partially Observed Environments

M. Fraccaro, Danilo Jimenez Rezende|arXiv (Cornell University)|Apr 25, 2018
Artificial Intelligence in Games被引用 19
一句话总结

该论文提出了一种可扩展的动作条件生成时序模型,带有空间记忆(GTM-SM),可在部分观测的2D和3D环境中实现长期预测。通过使用状态空间模型和变分自编码器(VAE)将低维智能体动态与高维视觉观测解耦,并将解缠表示存储在可微神经字典(DND)中,该模型在无需学习复杂记忆寻址机制的情况下,实现了在复杂环境中的数百时间步的连贯、端到端生成。

ABSTRACT

In model-based reinforcement learning, generative and temporal models of environments can be leveraged to boost agent performance, either by tuning the agent's representations during training or via use as part of an explicit planning mechanism. However, their application in practice has been limited to simplistic environments, due to the difficulty of training such models in larger, potentially partially-observed and 3D environments. In this work we introduce a novel action-conditioned generative model of such challenging environments. The model features a non-parametric spatial memory system in which we store learned, disentangled representations of the environment. Low-dimensional spatial updates are computed using a state-space model that makes use of knowledge on the prior dynamics of the moving agent, and high-dimensional visual observations are modelled with a Variational Auto-Encoder. The result is a scalable architecture capable of performing coherent predictions over hundreds of time steps across a range of partially observed 2D and 3D environments.

研究动机与目标

  • 解决在标准RNN因高维状态向量而失效的、部分观测的3D环境中长期视觉预测的挑战。
  • 通过引入非参数化空间记忆系统,克服参数化记忆模型在复杂空间环境中的局限性。
  • 利用结构化记忆和动态先验,实现高维视觉观测在数百时间步内的可扩展、连贯生成。
  • 开发一种模型,支持未来集成到基于模型的强化学习中,用于空间任务规划。

提出的方法

  • 将潜在状态分解为低维动态向量(智能体位置)和高维视觉表征(帧编码)。
  • 使用包含运动物理先验知识的状态空间模型来建模智能体动态,并通过回归损失学习转移参数。
  • 使用变分自编码器(VAE)对视觉观测进行编码,以学习解缠、高容量的表征。
  • 将配对的位置-视觉表征存储在可微神经字典(DND)中,这是一种非参数化记忆,支持高效检索。
  • 通过基于当前估计位置从DND中检索相似过去状态,并向前传播动态,实现长时程生成。
  • 使用智能体轨迹中的视频序列和对应的动作序列,对模型进行端到端训练。

实验结果

研究问题

  • RQ1具有空间记忆的生成模型是否能在部分观测的3D环境中实现连贯的长期预测?
  • RQ2与标准RNN相比,分离动态与视觉表征是否能提升可扩展性和训练稳定性?
  • RQ3在无需复杂注意力机制的情况下,DND这类非参数化记忆是否能在时空建模中优于参数化记忆寻址?
  • RQ4该模型在具有多个房间和复杂纹理的更大环境中的泛化能力如何?
  • RQ5在单次探索阶段后,模型在零样本预测中的表现如何?

主要发现

  • GTM-SM模型在单间3D环境中成功生成了长达300个时间步的连贯视觉预测,准确重建了墙壁和地板。
  • 模型在297个时间步内对智能体位移的预测达到高精度,表明其具有鲁棒的长期动态建模能力。
  • 在总时长为450个时间步的多房间环境中,模型保持了连贯的纹理和结构生成,显示出超越单间环境的可扩展性。
  • 模型无法准确渲染复杂物体纹理,表明基于VAE的视觉表征学习在高度多样的视觉模式下存在局限性。
  • 由于未使用学习的记忆寻址机制,训练速度更快且更稳定,优于Gemici等人(2017)提出的模型。
  • 使用回归损失在真实位移上优化的状态空间模型显著提升了转移准确率和长时程预测保真度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。