Skip to main content
QUICK REVIEW

[论文解读] Return-Based Contrastive Representation Learning for Reinforcement Learning

Guoqing Liu, Chuheng Zhang|arXiv (Cornell University)|Feb 22, 2021
Reinforcement Learning in Robotics参考文献 46被引用 18
一句话总结

本文提出了一种基于回报的对比表示学习(RCRL),这是一种在深度强化学习中新颖的对比辅助任务,利用回报信号来训练表示,以区分具有相似与不同回报的状态-动作对。RCRL在Atari和DMControl基准测试中,在低数据场景下提升了样本效率和性能,优于强基线方法,并能与现有方法协同增效。

ABSTRACT

Recently, various auxiliary tasks have been proposed to accelerate representation learning and improve sample efficiency in deep reinforcement learning (RL). However, existing auxiliary tasks do not take the characteristics of RL problems into consideration and are unsupervised. By leveraging returns, the most important feedback signals in RL, we propose a novel auxiliary task that forces the learnt representations to discriminate state-action pairs with different returns. Our auxiliary loss is theoretically justified to learn representations that capture the structure of a new form of state-action abstraction, under which state-action pairs with similar return distributions are aggregated together. In low data regime, our algorithm outperforms strong baselines on complex tasks in Atari games and DeepMind Control suite, and achieves even better performance when combined with existing auxiliary tasks.

研究动机与目标

  • 通过引入对回报敏感的辅助任务,解决深度强化学习在低数据场景下的样本效率低下问题。
  • 开发一种理论基础扎实的表示学习方法,以捕捉基于回报分布的新状态-动作抽象结构。
  • 通过训练表示对回报无关特征保持不变,同时保留与回报相关的关键区分性,从而提升策略学习效果。
  • 证明基于回报的对比学习可与现有无监督对比方法有效结合,实现进一步的性能提升。

提出的方法

  • RCRL基于回报相似性构建正样本对与负样本对:正样本对具有相同或相似的回报,负样本对则具有不相似的回报。
  • 使用动量编码器和预测头训练对比损失,以区分正负状态-动作表示。
  • 该方法利用Z^π-无关性抽象,这是一种新颖的状态-动作抽象方式,将具有相似回报分布的策略π下的状态-动作对进行分组。
  • 提出Z-学习,通过采样回报而非完整回报分布来近似Z^π-无关性,从而实现实际训练。
  • 通过等权重和共享学习率的方式,将辅助损失与主强化学习算法(如Rainbow、SAC)集成,降低超参数敏感性。
  • 正样本对从轨迹中连续的片段中收集,以确保回报相似性;负样本对则从回放缓冲区中随机采样。

实验结果

研究问题

  • RQ1基于回报的对比学习是否能提升深度强化学习中的表示质量与样本效率?
  • RQ2所提出的Z^π-无关性抽象是否能在保持Q值准确性的同时,减小状态-动作空间的有效规模?
  • RQ3在Atari和DMControl环境中,与强基线相比,RCRL在低数据场景下的表现如何?
  • RQ4RCRL是否能与现有无监督对比方法有效结合,以实现进一步的性能提升?

主要发现

  • 在低数据场景(100k次交互)下,RCRL在55款Atari游戏中有53款优于强基线,中位数人类归一化得分为182.4%。
  • 在DMControl套件中,RCRL的表现优于基线,在复杂连续控制任务中取得显著提升。
  • 在高数据场景(150万次交互)下,RCRL在5款Atari游戏中的4款仍优于基线,表明其具有广泛适用性。
  • 表示分析显示,RCRL学习到的表示中,具有相似回报分布的样本产生相似嵌入,而回报不相似的样本则产生不同嵌入,从而加速泛化。
  • 该方法对超参数调优具有鲁棒性,使用辅助任务与主强化学习任务相同的损失权重和学习率,未导致性能下降。
  • 当与CURL结合时,RCRL实现更优性能,证明其与现有无监督对比方法具有兼容性与协同增效作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。