[论文解读] Measuring Visual Generalization in Continuous Control from Pixels
本文提出DMCR,一个基准测试,通过在DeepMind Control Suite中引入光照、相机角度和场景变化等多样化的视觉变化,评估连续控制智能体的视觉泛化能力。研究发现,数据增强显著优于自监督方法,且复杂的颜色变换能提升泛化能力,揭示了当前表示学习在真实世界部署中的局限性。
Self-supervised learning and data augmentation have significantly reduced the performance gap between state and image-based reinforcement learning agents in continuous control tasks. However, it is still unclear whether current techniques can face a variety of visual conditions required by real-world environments. We propose a challenging benchmark that tests agents' visual generalization by adding graphical variety to existing continuous control domains. Our empirical analysis shows that current methods struggle to generalize across a diverse set of visual changes, and we examine the specific factors of variation that make these tasks difficult. We find that data augmentation techniques outperform self-supervised learning approaches and that more significant image transformations provide better visual generalization \footnote{The benchmark and our augmented actor-critic implementation are open-sourced @ https://github.com/QData/dmc_remastered)
研究动机与目标
- 评估当前强化学习智能体在真实世界环境中常见的多样化视觉条件下是否具备泛化能力。
- 识别阻碍基于图像的连续控制智能体泛化能力的具体视觉变化因素。
- 在视觉域偏移条件下,基准测试表示学习技术(尤其是数据增强与自监督学习)的有效性。
- 提供一个可复现、可扩展的基准测试,用于评估连续控制中的视觉泛化能力,通过引入图形多样性扩展DeepMind Control Suite。
提出的方法
- 通过修改图形资源,扩展DeepMind Control Suite(DMC),引入光照、相机位置、颜色和场景的受控变化。
- 引入零样本视觉泛化基准测试,智能体在未在训练中出现过的视觉条件下进行评估。
- 使用SAC训练智能体,并应用多种表示学习技术:DrQ风格的随机裁剪(AUG)、颜色抖动(CJ)和网络随机化(NR)。
- 通过同一状态在不同渲染下的编码器表示方差来度量视觉泛化能力,方差越低表示不变性越强。
- 在多种控制任务(如Cartpole、Ball in Cup)下,评估不同视觉扰动下的性能表现。
- 使用空间激活图和表示标准差分析模型注意力机制以及对纹理和背景变化的鲁棒性。
实验结果
研究问题
- RQ1当前基于图像的强化学习智能体在面对光照、相机角度和背景场景等变化的未见视觉条件时,泛化能力如何?
- RQ2在连续控制中,数据增强与自监督学习哪种表示学习技术能带来更好的视觉泛化能力?
- RQ3复杂的图像变换(如颜色抖动和网络随机化)在多大程度上提升了对视觉域偏移的鲁棒性?
- RQ4哪些具体的视觉因素(如纹理、颜色、背景)最可能破坏智能体性能和表示一致性?
- RQ5一个具有受控图形变化的基准测试,能否作为评估强化学习在真实世界视觉泛化能力的可靠代理?
主要发现
- 数据增强技术,特别是颜色抖动和网络随机化,显著优于自监督学习方法,在多样化视觉条件下的视觉泛化能力表现更优。
- 使用颜色改变变换(如CJ、NR)训练的智能体,在同一状态的不同视觉渲染下表现出更低的表示方差,表明其具备更强的不变性。
- 即使采用强大的数据增强,智能体在地板纹理和场景变化方面仍难以泛化,表明其对视觉干扰物仍存在持续敏感性。
- 使用网络随机化或颜色抖动时,编码器输出的标准差显著降低,表明状态表示更加一致。
- DMCR基准测试成功隔离并度量了视觉泛化能力,揭示了当前方法在高视觉多样性环境下的真实世界部署中仍显不足。
- 空间激活图显示,经过CJ或NR训练的智能体受地板纹理变化的影响更小,证实了其感知鲁棒性的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。