Skip to main content
QUICK REVIEW

[论文解读] Denoised MDPs: Learning World Models Better Than the World Itself

Tongzhou Wang, Simon S. Du|arXiv (Cornell University)|Jun 30, 2022
Reinforcement Learning in Robotics被引用 6
一句话总结

本文提出Denoised MDPs,一种通过显式分离不可控且与奖励无关的噪声从观测中,以学习世界模型的方法,从而实现更高效和鲁棒的强化学习。通过将信号(可控且与奖励相关)与噪声分离,该方法在各类控制与非控制任务中均表现出更优性能,在噪声环境和原始图像观测下优于先前方法。

ABSTRACT

The ability to separate signal from noise, and reason with clean abstractions, is critical to intelligence. With this ability, humans can efficiently perform real world tasks without considering all possible nuisance factors.How can artificial agents do the same? What kind of information can agents safely discard as noises? In this work, we categorize information out in the wild into four types based on controllability and relation with reward, and formulate useful information as that which is both controllable and reward-relevant. This framework clarifies the kinds information removed by various prior work on representation learning in reinforcement learning (RL), and leads to our proposed approach of learning a Denoised MDP that explicitly factors out certain noise distractors. Extensive experiments on variants of DeepMind Control Suite and RoboDesk demonstrate superior performance of our denoised world model over using raw observations alone, and over prior works, across policy optimization control tasks as well as the non-control task of joint position regression.

研究动机与目标

  • 正式区分真实强化学习环境中信号与噪声的界限。
  • 识别并移除不可控或与奖励无关的噪声干扰项,以提升世界模型质量。
  • 开发一种可学习的框架,自动分离此类噪声,从而实现更高效和鲁棒的策略优化。
  • 证明去噪世界模型不仅适用于控制任务,还能在非控制回归任务中提升性能。

提出的方法

  • 基于可控性与奖励相关性,将环境信息划分为四类:可控/与奖励相关、可控/无关、不可控/与奖励相关、不可控/无关。
  • 提出Denoised MDPs作为框架,显式地仅将可控且与奖励相关组件建模为核心状态表示。
  • 采用基于变分自编码器的架构,将观测解耦为信号与噪声分量,且约束噪声与奖励无关。
  • 应用对比学习目标,促使信号空间具备对未来状态与奖励的预测能力。
  • 施加归纳偏置,强制信号具有可控性,噪声同时具备不可控性与与奖励无关性。
  • 通过重构、对比学习与奖励预测目标的组合,端到端训练世界模型。

实验结果

研究问题

  • RQ1我们能否基于可控性与奖励相关性,系统性地将环境信息划分为信号与噪声?
  • RQ2一种显式去除不可控且与奖励无关噪声的可学习世界模型,是否能超越基于原始观测训练的模型?
  • RQ3去噪是否不仅提升控制任务性能,也提升非控制、监督回归任务的性能?
  • RQ4在所提框架下,面对多样化的噪声类型,现有方法如TIA与CURL的表现如何?

主要发现

  • 在DeepMind Control Suite的四种噪声变体(传感器噪声、相机抖动、视频背景、噪声传感器)中,Denoised MDPs在所有设置下均持续优于TIA、CURL及其他基线方法。
  • 该方法在控制任务与联合位置回归任务中均达到最先进性能,证明其在强化学习之外也具备泛化能力。
  • 在Reacher Easy with Video Background设置中,Denoised MDPs的平均回报比TIA高出25%,比CURL高出15%。
  • 可视化结果证实,Denoised MDPs能正确地将智能体运动识别为信号,将背景变化识别为噪声,而TIA未能实现有效分离。
  • 基于Denoised MDPs训练的模型基智能体在样本效率与鲁棒性方面均优于模型自由基线。
  • 去噪世界模型可实现精确的关节位置回归,表明清晰表征即使在标准强化学习目标之外也具有显著优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。