Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Visual Attention and Invariance for Reinforcement Learning

Xudong Wang, Long Lian|arXiv (Cornell University)|Apr 7, 2021
Reinforcement Learning in Robotics参考文献 62被引用 4
一句话总结

本文提出视觉注意力与不变性(VAI),一种无监督强化学习方法,通过可学习的适配器模块去除背景杂波并增强与任务相关的特征,实现对视觉观测的自适应。VAI在DeepMind Control和DrawerWorld基准上达到最先进性能,平均累积奖励较之前方法提高15%,推理时速度提升2倍以上,GPU显存使用减少40%。

ABSTRACT

Vision-based reinforcement learning (RL) is successful, but how to generalize it to unknown test environments remains challenging. Existing methods focus on training an RL policy that is universal to changing visual domains, whereas we focus on extracting visual foreground that is universal, feeding clean invariant vision to the RL policy learner. Our method is completely unsupervised, without manual annotations or access to environment internals. Given videos of actions in a training environment, we learn how to extract foregrounds with unsupervised keypoint detection, followed by unsupervised visual attention to automatically generate a foreground mask per video frame. We can then introduce artificial distractors and train a model to reconstruct the clean foreground mask from noisy observations. Only this learned model is needed during test to provide distraction-free visual input to the RL policy learner. Our Visual Attention and Invariance (VAI) method significantly outperforms the state-of-the-art on visual domain generalization, gaining 15 to 49% (61 to 229%) more cumulative rewards per episode on DeepMind Control (our DrawerWorld Manipulation) benchmarks. Our results demonstrate that it is not only possible to learn domain-invariant vision without any supervision, but freeing RL from visual distractions also makes the policy more focused and thus far better.

研究动机与目标

  • 在不依赖任务特定监督的前提下,提升强化学习智能体对视觉观测中干扰物的鲁棒性。
  • 通过在推理时避免对编码器进行反向传播,降低推理过程中的计算与显存开销。
  • 通过轻量级适配器模块,实现对新环境的高效、可扩展的适应,直接处理原始观测输入。
  • 提供一种视觉上可解释且可调试的方法,适用于真实场景中的部署。
  • 在具有不同背景和干扰物的环境中实现强泛化能力,包括类似真实世界场景的DrawerWorld环境。

提出的方法

  • 该方法使用可学习的适配器模块,将原始像素观测转换为更具不变性且聚焦注意力的表示,去除背景杂波并突出与任务相关的特征。
  • 适配器通过在图像块上进行自监督对比学习进行无监督训练,促使模型在保留身份信息的同时忽略无关的背景变化。
  • 适配器在观测空间中运行,而非潜在特征空间,从而支持对适配后输入的直接视觉解释与调试。
  • 强化学习智能体与适配器端到端联合训练,使用标准强化学习算法(如SAC),其中适配器参数在训练阶段通过反向传播更新,推理时冻结。
  • 该方法不依赖真实关键点标注或外部数据集,完全基于图像块上的自监督对比学习。
  • 评估过程中在多样化测试环境中使用固定适配器,不进行微调或基于部署数据的再训练,确保泛化能力与低部署成本。

实验结果

研究问题

  • RQ1无监督视觉自适应方法是否能在不依赖任务特定标注的前提下,提升强化学习智能体在干扰物丰富的视觉环境中的性能?
  • RQ2与基于特征空间的自适应方法(如PAD)相比,所提出的基于适配器的方法在推理速度和内存效率方面表现如何?
  • RQ3该适配器在具有不同纹理、光照和干扰物配置的未见环境中,泛化能力达到何种程度?
  • RQ4对适配器输出的视觉检查是否能提供可靠、人类可解释的部署准备度诊断?
  • RQ5通过无监督自适应去除背景杂波,是否能提升在干扰物存在情况下的策略学习稳定性与鲁棒性?

主要发现

  • 在DeepMind Control的干扰物丰富环境中,VAI在平均累积奖励上比之前最先进方法(PAD)高出15%,达到806,而PAD为698。
  • 在Ball in Cup、抓取任务中,VAI获得956±4的累积奖励,相比PAD的545±173高出420分(相对提升77%)。
  • 推理时,VAI的速度超过PAD的2倍,且GPU显存使用减少40%,原因在于推理阶段避免了对编码器的反向传播。
  • 该方法在未见环境中泛化良好:即使背景发生显著变化,性能仍接近训练分布水平。
  • 可视化结果表明,适配器能有效抑制背景杂波并增强前景任务相关结构,但在高反射表面(如大理石)等情况下可能使模型困惑。
  • 适配器的输出具有视觉可解释性,可无需依赖策略滚动或奖励函数,快速判断部署适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。