Skip to main content
QUICK REVIEW

[论文解读] Structured World Belief for Reinforcement Learning in POMDP

Gautam B. Singh, Skand Vishwanath Peri|arXiv (Cornell University)|Jul 19, 2021
Reinforcement Learning in Robotics被引用 7
一句话总结

本文提出结构化世界信念(SWB),一种新颖的以对象为中心的世界模型,通过整合对象恒常性和信念状态,用于部分可观察马尔可夫决策过程(POMDP)中的强化学习。通过结合序贯蒙特卡洛推理(SMC)与可学习的以对象为中心的动力学模型,以及文件-槽匹配机制,SWB 在部分可观测环境下实现了鲁棒的长时程对象追踪,显著提升了视频生成、规划和强化学习任务的性能,相较于仅使用以对象为中心或仅使用信念表示的模型具有明显优势。

ABSTRACT

Object-centric world models provide structured representation of the scene and can be an important backbone in reinforcement learning and planning. However, existing approaches suffer in partially-observable environments due to the lack of belief states. In this paper, we propose Structured World Belief, a model for learning and inference of object-centric belief states. Inferred by Sequential Monte Carlo (SMC), our belief states provide multiple object-centric scene hypotheses. To synergize the benefits of SMC particles with object representations, we also propose a new object-centric dynamics model that considers the inductive bias of object permanence. This enables tracking of object states even when they are invisible for a long time. To further facilitate object tracking in this regime, we allow our model to attend flexibly to any spatial location in the image which was restricted in previous models. In experiments, we show that object-centric belief provides a more accurate and robust performance for filtering and generation. Furthermore, we show the efficacy of structured world belief in improving the performance of reinforcement learning, planning and supervised reasoning.

研究动机与目标

  • 解决现有以对象为中心的世界模型在部分可观察环境强化学习中缺乏信念状态和对象恒常性的问题。
  • 在长时间遮挡和非确定性重新出现的情况下,实现长期对象追踪。
  • 通过序贯蒙特卡洛(SMC)方法,实现以对象为中心的表征与信念状态估计的协同优化,提升推理能力与鲁棒性。
  • 构建一个可微分、端到端的框架,支持视频生成以及下游的强化学习/规划任务。

提出的方法

  • 利用序贯蒙特卡洛(SMC)方法,通过多个以对象为中心的场景假设(即粒子)来维护可能的世界状态,每个粒子代表一种可能的世界状态。
  • 提出一种新颖的以对象为中心的动力学模型,将对象存在性(文件)与可见性(槽)解耦,以实现对象恒常性。
  • 提出文件-槽匹配机制,以解决在长时间遮挡后,对象以非确定性、远距离方式重新出现时的重新关联难题。
  • 采用可学习的注意力机制,使模型能够灵活地关注图像中的任意位置,克服了先前模型中固定注意力机制的限制。
  • 使用自编码SMC目标函数,联合训练世界模型与提议分布,实现容错能力,并生成多样且合理的场景假设。
  • 结合基于RNN的状态转移建模与基于速度偏移的位置预测方法,实现对动态对象运动的建模。

实验结果

研究问题

  • RQ1能否有效结合以对象为中心的表征与信念状态,以提升在部分可观察环境中的性能?
  • RQ2如何在可微分的SMC框架中建模对象恒常性,以在长时间遮挡后仍保持对象身份?
  • RQ3在对象以非确定性、远距离方式重新出现时,需要何种机制来解决重新关联的模糊性问题?
  • RQ4以对象为中心的信念集成如何改善视频生成、规划与强化学习等下游任务的性能?
  • RQ5在复杂POMDP中,增加SMC粒子数量在多大程度上能提升信念推理的准确性与鲁棒性?

主要发现

  • SWB在视频建模、生成与追踪任务中,优于仅使用以对象为中心表征或仅使用信念表示的模型。
  • 通过维持准确、多样且持久的以对象为中心的信念状态,模型在强化学习与规划任务中实现了性能提升。
  • 增加SMC粒子数量可带来更精确的信念估计与更优的下游性能,证明了该方法的可扩展性。
  • 文件-槽匹配机制使模型在长时间遮挡后仍能可靠地重新关联对象,显著提升了追踪鲁棒性。
  • 自编码SMC目标函数使模型能够优雅地处理追踪错误,同时维持多个合理的情景假设。
  • 实验结果表明,SWB在2D与3D POMDP基准测试中均达到最先进性能,包括2D迷宫与3D食物追逐环境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。