Skip to main content
QUICK REVIEW

[论文解读] Does Self-supervised Learning Really Improve Reinforcement Learning from Pixels?

Xiang Li, Jinghuan Shang|arXiv (Cornell University)|Jun 10, 2022
Advanced Fluorescence Microscopy Techniques被引用 9
一句话总结

本文研究了在联合自监督学习-强化学习(SSL-RL)框架下,自监督学习(SSL)是否能提升从像素输入的在线强化学习(RL)性能。尽管进行了大量实验,包括多种SSL损失函数和进化超参数搜索,研究发现当数据和数据增强方式保持不变时,SSL相较于仅使用图像增强的基线方法并无显著性能提升,表明当前的联合SSL-RL框架在样本效率和跨环境泛化能力方面仍存在局限。

ABSTRACT

We investigate whether self-supervised learning (SSL) can improve online reinforcement learning (RL) from pixels. We extend the contrastive reinforcement learning framework (e.g., CURL) that jointly optimizes SSL and RL losses and conduct an extensive amount of experiments with various self-supervised losses. Our observations suggest that the existing SSL framework for RL fails to bring meaningful improvement over the baselines only taking advantage of image augmentation when the same amount of data and augmentation is used. We further perform evolutionary searches to find the optimal combination of multiple self-supervised losses for RL, but find that even such a loss combination fails to meaningfully outperform the methods that only utilize carefully designed image augmentations. After evaluating these approaches together in multiple different environments including a real-world robot environment, we confirm that no single self-supervised loss or image augmentation method can dominate all environments and that the current framework for joint optimization of SSL and RL is limited. Finally, we conduct the ablation study on multiple factors and demonstrate the properties of representations learned with different approaches.

研究动机与目标

  • 评估在联合SSL-RL训练框架下,自监督学习(SSL)是否能提升从像素输入的在线强化学习(RL)性能。
  • 在多种环境(包括真实世界机器人设置)中,比较不同SSL损失函数与图像增强策略的性能表现。
  • 利用进化搜索识别SSL损失函数与增强幅度的最佳组合。
  • 分析不同SSL与增强方案下所学习表征的属性。
  • 评估当前联合SSL-RL框架在样本效率和跨环境泛化能力方面的局限性。

提出的方法

  • 将对比式RL框架(如CURL)扩展至联合优化SSL与RL损失,采用SAC和Rainbow DQN在连续动作空间与离散动作空间环境中进行训练。
  • 采用四种代表性成对SSL方法:MoCo、BYOL、SimSiam与DINO,均适配用于与RL联合训练。
  • 应用图像增强技术,如随机裁剪与平移,并对损失组合与增强幅度执行进化超参数搜索。
  • 通过聚类准确率与线性探测性能等指标,开展表征质量的消融研究,以分析所学特征。
  • 在多个基准测试中评估方法性能:DMControl(连续控制)、Atari(离散控制)以及一个真实世界机器人环境(Franka Picking)。
  • 采用预训练框架作为基线,与联合学习方法进行公平比较,确保各配置间数据使用量一致。

实验结果

研究问题

  • RQ1在联合优化自监督学习与强化学习时,是否能提升基于像素的RL任务的样本效率与最终性能?
  • RQ2通过进化搜索找到的多种自监督损失组合,是否能在相同数据与增强预算下超越仅使用图像增强的基线方法?
  • RQ3不同SSL方法所学习的表征在下游RL性能与内在质量指标方面有何差异?
  • RQ4在数据受限条件下,联合学习框架是否始终优于或劣于基于预训练的SSL-RL方法?
  • RQ5是否存在特定环境或任务,使得SSL相比简单数据增强能带来可测量的性能提升?

主要发现

  • 在相同数据与增强设置下,联合学习框架中任一单一SSL损失或其组合均未能超越仅使用图像增强的基线方法(如DrQ与RAD)。
  • 针对最优损失组合的进化搜索未能带来一致性能提升,仅ELo-SAC方法在“Longer”配置下达到与基于增强的基线相当的性能。
  • 预训练框架在大多数情况下优于联合学习,但该优势主要归因于其可访问额外数据,而非框架本身的优势。
  • 当数据严格受限时,联合学习框架的性能优于预训练方法,表明在数据受限条件下,联合学习可能更具样本效率。
  • 表征消融分析表明,SSL方法学习到的特征在不同环境中泛化能力不一致,且无单一SSL方法在所有任务中全面占优。
  • 在真实世界机器人环境中,所有SSL方法均未能显著超越仅使用增强的基线方法,凸显当前联合SSL-RL方法的实际局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。