Skip to main content
QUICK REVIEW

[论文解读] Contrastive Variational Model-Based Reinforcement Learning for Complex Observations.

Xiao Ma, Siwei Chen|arXiv (Cornell University)|Aug 6, 2020
Reinforcement Learning in Robotics被引用 10
一句话总结

该论文提出对比变分强化学习(CVRL),一种基于模型的强化学习框架,通过对比变分世界建模提升在复杂视觉观测设置下的鲁棒性与样本效率。通过对比学习最大化潜在状态与观测之间的互信息,CVRL在包含自然视觉观测的新基准Natural Mujoco上优于最先进生成式MBRL方法。

ABSTRACT

Deep model-based reinforcement learning (MBRL) has achieved great sample-efficiency and generalization in decision making for sophisticated simulated tasks, such as Atari games. However, real-world robot decision making requires reasoning with complex natural visual observations. This paper presents Contrastive Variational Reinforcement Learning (CVRL), an MBRL framework for complex natural observations. In contrast to the commonly used generative world models, CVRL learns a contrastive variational world model by maximizing the mutual information between latent states and observations discriminatively by contrastive learning. Contrastive learning avoids modeling the complex observation space and is significantly more robust than the standard generative world models. For decision making, CVRL discovers long-horizon behavior by online search guided by an actor-critic. CVRL achieves comparable performance with the state-of-the-art (SOTA) generative MBRL approaches on a series of Mujoco tasks, and significantly outperforms SOTAs on Natural Mujoco tasks, a new, more challenging continuous control RL benchmark with complex observations introduced in this paper.

研究动机与目标

  • 解决在复杂自然视觉观测下基于模型强化学习的样本效率与鲁棒性挑战。
  • 通过引入对比学习以最大化潜在状态与观测之间的互信息,克服生成式世界模型在高维观测空间中的局限性。
  • 通过在线策略-评论家引导的搜索,实现在连续控制任务中使用自然视觉输入的有效长时程决策。
  • 提出并评估Natural Mujoco,一个用于连续控制任务的新基准,包含复杂自然观测,以更真实地反映现实世界机器人学习的挑战。
  • 证明基于对比学习的世界模型在性能上可与生成模型媲美甚至超越,同时对复杂观测更具鲁棒性。

提出的方法

  • CVRL采用对比变分世界模型,通过对比学习最大化潜在状态与观测之间的互信息,学习潜在表征。
  • 对比学习目标通过观测及其对应潜在状态的正样本对与负样本对构建,避免对复杂观测空间进行显式密度估计。
  • 采用变分推理框架训练世界模型,实现端到端可微分性与在视觉输入上的可扩展训练。
  • 通过在线策略-评论家引导的搜索执行决策,利用世界模型规划长时程行为。
  • 该框架将世界模型与策略网络集成,策略网络通过模仿学习与强化学习目标的组合进行训练。
  • 该方法在标准MuJoCo环境及新引入的Natural MuJoCo基准上进行评估,后者使用真实世界视觉观测。

实验结果

研究问题

  • RQ1对比变分世界建模能否在复杂视觉观测下的基于模型强化学习中提升样本效率与鲁棒性?
  • RQ2在标准与自然视觉控制基准上,CVRL相较于最先进生成式MBRL方法在性能与样本效率方面表现如何?
  • RQ3与生成模型相比,对比学习在在多大程度上减少了对复杂观测分布显式建模的需求?
  • RQ4CVRL能否在具有自然视觉输入的环境中,通过在线搜索有效发现长时程行为?
  • RQ5所提出的Natural Mujoco基准是否为评估复杂观测下真实世界强化学习泛化能力提供了有意义的挑战?

主要发现

  • 在标准MuJoCo任务上,CVRL的性能与最先进生成式MBRL方法相当,展现出具有竞争力的样本效率与策略质量。
  • 在新引入的、包含复杂自然视觉观测的Natural MuJooco基准上,CVRL显著优于现有最先进生成式MBRL方法。
  • 对比变分世界模型有效捕捉了复杂观测中的相关信息,而无需建模完整的观测分布,从而提升了鲁棒性。
  • 与标准生成模型相比,对比学习在高维视觉空间中实现了更好的解耦与表征学习。
  • 在世界模型中使用在线策略-评论家引导搜索,实现了在复杂视觉环境中的有效长时程规划。
  • 结果验证了对比学习是视觉强化学习中世界模型的一种可行且更具鲁棒性的替代生成建模的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。