[论文解读] Contrastive Variational Reinforcement Learning for Complex Observations
该论文提出对比变分强化学习(CVRL),一种基于模型的强化学习框架,通过对比学习从复杂视觉观测中学习鲁棒的潜在世界模型,而无需像素级重建。通过对比目标最大化状态与观测之间的互信息,CVRL在具有动态阴影和杂乱背景的任务中表现优越,在Natural Mujoco和推箱任务上超越了最先进方法,同时保持了出色的样本效率。
Deep reinforcement learning (DRL) has achieved significant success in various robot tasks: manipulation, navigation, etc. However, complex visual observations in natural environments remains a major challenge. This paper presents Contrastive Variational Reinforcement Learning (CVRL), a model-based method that tackles complex visual observations in DRL. CVRL learns a contrastive variational model by maximizing the mutual information between latent states and observations discriminatively, through contrastive learning. It avoids modeling the complex observation space unnecessarily, as the commonly used generative observation model often does, and is significantly more robust. CVRL achieves comparable performance with state-of-the-art model-based DRL methods on standard Mujoco tasks. It significantly outperforms them on Natural Mujoco tasks and a robot box-pushing task with complex observations, e.g., dynamic shadows. The CVRL code is available publicly at https://github.com/Yusufma03/CVRL.
研究动机与目标
- 解决在观测为高维且包含复杂无关视觉干扰(如动态阴影和移动背景)时,深度强化学习中有效世界模型学习的挑战。
- 通过用判别式对比表示学习替代生成式观测建模,提升基于模型强化学习中的鲁棒性与样本效率。
- 通过混合演员-评论家与潜在引导模型预测控制(MPC)框架,实现在复杂环境中的长时程规划与决策。
- 证明通过对比学习最大化互信息可生成比传统变分自编码器生成建模更稳定、更准确的世界模型,尤其在复杂观测下。
提出的方法
- CVRL引入了一种新型对比证据下界(CELBO),通过对比真实状态-观测对与虚假对,最大化潜在状态与观测之间的互信息。
- 该方法采用对比变分世界模型,通过将真实对(s_t, o_t)与负样本对(s_t, o'_t)进行评分来学习表示,避免对复杂观测的直接重建。
- 使用SAC(软演员-评论家)训练混合演员-评论家策略,以实现鲁棒且高效的策略更新,尤其适用于高维复杂观测空间。
- 采用潜在引导模型预测控制(MPC)进行长时程规划,利用学习到的世界模型生成动作序列。
- 该框架结合在线学习与通过CELBO训练的世界模型,实现在自然环境中样本高效且鲁棒的决策。
- 负样本通过随机增强或从不同轨迹中采样生成,对比损失促使模型区分相关与无关观测。
实验结果
研究问题
- RQ1对比表示学习能否提升在复杂视觉观测下基于模型强化学习中世界模型的鲁棒性?
- RQ2用判别式对比学习替代生成式观测建模,是否能在具有动态和杂乱视觉背景的任务中带来更好性能?
- RQ3对比学习、潜在引导MPC与SAC的结合,如何提升连续控制任务中的长时程决策能力?
- RQ4各组件(对比学习、MPC、SAC)对整体性能的贡献如何,尤其在具有挑战性的环境中?
- RQ5在样本效率与复杂任务鲁棒性方面,CVRL与最先进基于模型的强化学习方法(如Dreamer)相比如何?
主要发现
- CVRL在包含动态阴影和可变背景等复杂观测的Natural Mujoco基准测试中,显著优于最先进基于模型的强化学习方法。
- 在具有复杂视觉干扰的机器人推箱任务中,CVRL获得了最高累计奖励与最短执行时长,优于Dreamer与SAC。
- 消融研究显示,对比学习组件至关重要——仅使用奖励的CVRL与生成式CVRL变体性能显著下降,证实对比学习是鲁棒性的关键驱动力。
- 移除潜在引导MPC(CVRL-no-MPC)导致10项任务中有8项性能下降,尤其在长时程任务(如cartpole-swingup与quadruped-walk)中表现更差。
- 移除SAC的混合演员-评论家(CVRL-no-SAC)在高状态-观测耦合任务中性能下降,表明当世界模型误差较高时,SAC提供了关键的训练信号。
- 在标准Mujoco任务(观测更简单)中,CVRL与Dreamer表现相当,但在walker-run与cheetah-run任务中略逊一筹,表明当观测复杂度较低时,对比学习优势减弱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。