[论文解读] Temporal Disentanglement of Representations for Improved Generalisation in Reinforcement Learning
本文提出了时间解缠(Temporal Disentanglement, TED),一种自监督的辅助任务,通过利用序列观测中的时间一致性,在强化学习中学习解缠表示。TED 提升了对未见过的环境变量(包括任务无关的,如背景颜色;以及任务相关的,如目标位置)的泛化能力,使模型在图像强化学习设置下能够实现比最先进方法更快的适应速度和更好的性能恢复。
Reinforcement Learning (RL) agents are often unable to generalise well to environment variations in the state space that were not observed during training. This issue is especially problematic for image-based RL, where a change in just one variable, such as the background colour, can change many pixels in the image. The changed pixels can lead to drastic changes in the agent's latent representation of the image, causing the learned policy to fail. To learn more robust representations, we introduce TEmporal Disentanglement (TED), a self-supervised auxiliary task that leads to disentangled image representations exploiting the sequential nature of RL observations. We find empirically that RL algorithms utilising TED as an auxiliary task adapt more quickly to changes in environment variables with continued training compared to state-of-the-art representation learning methods. Since TED enforces a disentangled structure of the representation, our experiments also show that policies trained with TED generalise better to unseen values of variables irrelevant to the task (e.g. background colour) as well as unseen values of variables that affect the optimal policy (e.g. goal positions).
研究动机与目标
- 解决基于图像的强化学习智能体在未见环境变化(如背景颜色或目标位置变化)下的泛化能力差的问题。
- 克服领域随机化和不变表示学习的局限性,后者在样本效率上表现不佳或无法泛化到与任务相关的变量。
- 开发一种自监督、在线的方法,利用连续时间步的时序数据学习解缠表示,避免依赖独立同分布数据。
- 通过允许智能体在不发生灾难性遗忘的情况下快速适应新环境值,实现强化学习中的终身学习。
- 通过在潜在表征中强制实施解缠结构,提升分布偏移后的鲁棒性与性能恢复能力。
提出的方法
- 提出 TED,一种自监督辅助损失,通过对比时间相邻观测的表征来鼓励解缠。
- 使用两类非时序样本:(1) 来自同一episode的样本(非平稳特征),以及 (2) 来自不同episode的样本(平稳特征),以分离由智能体控制和环境控制的因素。
- 训练一个具有解缠结构的对比分类器,学习区分由智能体行为引起的变化与由环境变化引起的变化。
- 将 TED 作为辅助损失集成到现有强化学习算法(如 RAD、SAC、PPO)中,仅需极少的网络架构修改,且无需解码器。
- 通过超参数 α 优化 TED 损失,以平衡解缠程度与策略性能,通过实验调优获得最优泛化效果。
- 使用基于 factor-VAE 的解缠度量指标评估所学表征的质量,结果表明 TED 显著提升了表征的解缠程度。
实验结果
研究问题
- RQ1基于时间一致性的自监督辅助任务能否提升基于图像的强化学习在未见环境变量值下的泛化能力?
- RQ2通过时间对比学习学习解缠表示是否能带来更快的适应速度和在分布偏移后更好的性能恢复?
- RQ3在对任务无关与任务相关环境变量的泛化能力方面,TED 与最先进表示学习方法相比表现如何?
- RQ4仅使用同一episode或仅使用不同episode的非时序样本,对泛化性能有何影响?
- RQ5与标准线性分类器相比,TED 中解缠分类器结构的重要性有多大?
主要发现
- TED 显著提升了三种基础强化学习算法(RAD、SAC、PPO)在未见环境变量值下的泛化能力,涵盖无关因素(如背景颜色)和相关因素(如目标位置)。
- 在持续训练过程中,使用 TED 训练的智能体能更快适应新的环境值,比基线方法更快速地恢复最优策略性能。
- 消融实验表明,同时使用同一episode和不同episode的非时序样本可获得最佳泛化性能,优于仅使用其中一类样本的版本。
- 将解缠分类器替换为标准线性分类器会降低泛化性能,证明 TED 中解缠结构的重要性。
- TED 损失系数 α 必须仔细调优:α=200 时达到最优性能,而 α=50 或 α=500 会导致泛化能力下降,分别因解缠不足或过度。
- TED 提升了 factor-VAE 指标上的解缠度量分数,证实所学表征比基线方法更解缠,即使没有显式监督。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。