Skip to main content
QUICK REVIEW

[论文解读] Generalization in Reinforcement Learning by Soft Data Augmentation

Nicklas Hansen, Xiaolong Wang|arXiv (Cornell University)|Nov 26, 2020
Reinforcement Learning in Robotics参考文献 43被引用 16
一句话总结

本文提出 SODA,一种用于视觉强化学习的软数据增强方法,其将表征学习与策略优化解耦。通过训练一个共享编码器,使增强后的观测与原始观测之间的互信息最大化,同时在非增强数据上训练策略,SODA 提升了样本效率、泛化能力与训练稳定性——在 DMControl-GB 的 9 项任务中达到最先进性能,并在所有机器人操控测试环境中表现优异。

ABSTRACT

Extensive efforts have been made to improve the generalization ability of Reinforcement Learning (RL) methods via domain randomization and data augmentation. However, as more factors of variation are introduced during training, optimization becomes increasingly challenging, and empirically may result in lower sample efficiency and unstable training. Instead of learning policies directly from augmented data, we propose SOft Data Augmentation (SODA), a method that decouples augmentation from policy learning. Specifically, SODA imposes a soft constraint on the encoder that aims to maximize the mutual information between latent representations of augmented and non-augmented data, while the RL optimization process uses strictly non-augmented data. Empirical evaluations are performed on diverse tasks from DeepMind Control suite as well as a robotic manipulation task, and we find SODA to significantly advance sample efficiency, generalization, and stability in training over state-of-the-art vision-based RL methods.

研究动机与目标

  • 为解决在视觉强化学习中直接在增强数据上进行策略训练所导致的不稳定性和样本效率降低问题。
  • 在不损害训练稳定性的情况下,提升对视觉上多样化、未见过环境的泛化能力。
  • 开发一种方法,利用强数据增强进行表征学习,同时最小化对强化学习优化的干扰。
  • 建立评估视觉强化学习中泛化能力的新基准。
  • 证明将增强与策略学习解耦可优于当前最先进方法,实现更优性能。

提出的方法

  • SODA 使用一个共享编码器,将增强后的观测与非增强观测均映射到潜在空间。
  • 通过最大化增强观测与原始观测潜在表示之间的互信息,施加软约束。
  • 策略学习仅在非增强数据上进行,以保持优化稳定性。
  • 采用动量更新的目标网络来处理非增强观测,以稳定表征学习。
  • 数据增强仅在辅助表征学习任务中应用,不用于策略训练。
  • 该方法为自监督学习,无需负样本,与 CURL 等对比方法不同。

实验结果

研究问题

  • RQ1我们能否在使用数据增强时,提升视觉强化学习中的泛化能力,同时避免策略训练的不稳定性?
  • RQ2将数据增强与策略学习解耦,是否能带来更高的样本效率与训练稳定性?
  • RQ3增强观测与原始观测之间互信息的最大化,能否增强表征的不变性?
  • RQ4与当前最先进方法相比,SODA 在多样且视觉挑战性强的测试环境中表现如何?
  • RQ5SODA 在随机相机、光照与纹理条件下,能否有效泛化至真实世界部署场景?

主要发现

  • 在 DMControl 通用泛化基准的 10 项环境中有 9 项中,SODA 表现优于当前最先进方法,尤其在视频背景测试条件下,ball_in_cup_catch 任务的性能提升高达 81%。
  • 在机器人操控任务中,SODA 在训练环境中平均回报达 21.3,在随机颜色测试环境中达 18.0,显著优于基线方法。
  • SODA 降低了训练方差,提升了样本效率,表现为 DMControl 与机器人操控任务中训练与泛化曲线更加平滑。
  • 该方法在随机颜色与视频背景环境中均表现出良好泛化能力,即使增强类型(如叠加与卷积)与测试时分布不同亦然。
  • 使用叠加增强的 SODA 比使用随机卷积增强泛化能力更强,表明更丰富的增强方式有助于提升不变性学习。
  • SODA 在机器人操控任务的所有测试分布中均表现优异,包括随机相机、光照与纹理变化,表明其具备强大的真实世界部署潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。