[论文解读] Cross-Trajectory Representation Learning for Zero-Shot Generalization in RL
本文提出了一种自监督表示学习方法——跨轨迹表示学习(CTRL),用于强化学习,通过训练编码器将行为相似的轨迹映射到相似的潜在表示,从而在不依赖奖励信号的情况下提升零样本泛化能力。CTRL 在代理自身策略的轨迹表示上使用基于聚类的对比学习目标,结合PPO算法时在Procgen基准测试中实现了最先进性能,优于端到端强化学习及其他自监督方法。
A highly desirable property of a reinforcement learning (RL) agent -- and a major difficulty for deep RL approaches -- is the ability to generalize policies learned on a few tasks over a high-dimensional observation space to similar tasks not seen during training. Many promising approaches to this challenge consider RL as a process of training two functions simultaneously: a complex nonlinear encoder that maps high-dimensional observations to a latent representation space, and a simple linear policy over this space. We posit that a superior encoder for zero-shot generalization in RL can be trained by using solely an auxiliary SSL objective if the training process encourages the encoder to map behaviorally similar observations to similar representations, as reward-based signal can cause overfitting in the encoder (Raileanu et al., 2021). We propose Cross-Trajectory Representation Learning (CTRL), a method that runs within an RL agent and conditions its encoder to recognize behavioral similarity in observations by applying a novel SSL objective to pairs of trajectories from the agent's policies. CTRL can be viewed as having the same effect as inducing a pseudo-bisimulation metric but, crucially, avoids the use of rewards and associated overfitting risks. Our experiments ablate various components of CTRL and demonstrate that in combination with PPO it achieves better generalization performance on the challenging Procgen benchmark suite (Cobbe et al., 2020).
研究动机与目标
- 为高维观测空间的深度强化学习提升零样本泛化能力,其中在未见过但相似的任务之间实现泛化至关重要。
- 通过用无奖励依赖、基于行为的自监督目标替代依赖奖励的监督,解决表示学习中的奖励相关过拟合风险。
- 开发一种表示学习方法,捕捉轨迹间的行为主相似性,而无需外部监督或预定义的策略相似性度量。
- 证明无监督学习轨迹级行为主相似性可带来优于现有对比学习或内在好奇心驱动方法的泛化性能。
提出的方法
- CTRL 使用自监督对比学习目标对代理自身策略在训练过程中收集的轨迹表示进行训练,以优化神经编码器。
- 通过在线聚类将轨迹表示基于行为相似性动态分组为原型,形成对比学习的正样本对。
- 在相邻聚类的表示之间应用交叉预测损失,促使模型学习行为相似轨迹的一致性、低维表示。
- 该方法在标准强化学习框架(如PPO)内运行,对比学习目标在策略优化过程中应用,以提升表示质量,而无需修改主强化学习目标。
- CTRL 隐式学习了信念状态上的伪双芽度量,与形式化双芽度量一致,但避免了对奖励的依赖及其带来的过拟合问题。
- 该方法模块化,可与任意离策略或同策略强化学习算法结合,已在Procgen基准测试套件中进行了实证验证。
实验结果
研究问题
- RQ1在不依赖奖励信号的情况下,对轨迹应用自监督对比学习目标是否能提升深度强化学习中的零样本泛化能力?
- RQ2在强化学习中,学习轨迹间的行为主相似性是否优于现有表示学习方法(如DIAYN或Proto-RL)?
- RQ3轨迹表示聚类的时间动态特性如何影响零样本强化学习设置下的泛化性能?
- RQ4无奖励、基于行为的表示学习方法能否实现与基于奖励或基于度量的方法(如PSE或DBC)相当或更优的性能?
主要发现
- CTRL 与 PPO 结合在 Procgen 基准测试中实现了最先进水平的零样本泛化性能,优于大多数环境下的 DAAC、PPO+DIAYN 和 Proto-RL。
- 平均而言,PPO+CTRL 在所有 Procgen 环境中实现了 6.1 的平均回报,显著优于 PPO+DAAC(平均 5.2)和 PPO+Proto-RL(平均 5.5)。
- 消融实验表明,聚类收敛较慢时泛化能力更强,表明表示学习中的时间动态特性对零样本泛化至关重要。
- 尽管 PSE 和 DBC 使用了策略相似性度量,CTRL 仍表现更优,表明在此设置下,隐式、基于轨迹的相似性学习比显式度量方法更有效。
- 该方法对背景变化和未见过的任务动态表现出鲁棒性,在 'heist'、'plunder' 和 'fruitbot' 等挑战性环境中表现优异。
- 在玩具环境中,CTRL 有效捕捉了局部行为变化,证实其在无奖励监督下学习细粒度行为主相似性能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。