[论文解读] Robust Task Representations for Offline Meta-Reinforcement Learning via Contrastive Learning
该论文提出 CORRO,一种用于离线元强化学习中鲁棒任务表征学习的对比学习框架,通过将任务身份与行为策略特征解耦,实现对分布外(OOD)行为策略的优越泛化能力。通过双层网络编码单个转移元组,并采用基于 InfoNCE 的对比目标结合策略鲁棒的负样本采样,CORRO 在 OOD 基准测试中性能相比先前方法最高提升 115%。
We study offline meta-reinforcement learning, a practical reinforcement learning paradigm that learns from offline data to adapt to new tasks. The distribution of offline data is determined jointly by the behavior policy and the task. Existing offline meta-reinforcement learning algorithms cannot distinguish these factors, making task representations unstable to the change of behavior policies. To address this problem, we propose a contrastive learning framework for task representations that are robust to the distribution mismatch of behavior policies in training and test. We design a bi-level encoder structure, use mutual information maximization to formalize task representation learning, derive a contrastive learning objective, and introduce several approaches to approximate the true distribution of negative pairs. Experiments on a variety of offline meta-reinforcement learning benchmarks demonstrate the advantages of our method over prior methods, especially on the generalization to out-of-distribution behavior policies. The code is available at https://github.com/PKU-AI-Edge/CORRO.
研究动机与目标
- 解决在测试阶段行为策略与训练阶段不一致时,离线元强化学习中任务表征的不稳定性问题。
- 在离线数据集中将任务身份与行为策略特征解耦,其中两者共同决定数据分布。
- 提升对分布外(OOD)行为策略的泛化能力,这是实际离线元强化学习中的关键挑战。
- 开发一种学习对行为策略变化不敏感的任务表征的对比学习框架。
- 设计有效的负样本对生成策略,以近似真实负样本转移的分布。
提出的方法
- 提出双层编码结构:第一层对单个转移元组(s, a, r, s')进行编码,第二层将元组间的表征聚合为任务嵌入。
- 将任务表征学习形式化为表征与真实任务之间互信息最大化的问题,同时最小化行为策略的影响。
- 基于 InfoNCE 下界推导出对比学习目标,以最大化相同任务的正样本对相似度,最小化不同任务的负样本对相似度。
- 提出两种负样本对生成方法:生成建模(使用 CVAE 采样转移)和奖励扰动(通过扰动奖励生成多样化负样本)。
- 采用重标记和基线方法“None”进行对比,其中负样本对由来自不同任务的转移构成,且(s, a)可能不同。
- 采用基于 InfoNCE 的对比损失优化表征网络,确保对行为策略分布偏移的鲁棒性。
实验结果
研究问题
- RQ1在离线元强化学习中,对转移元组进行对比学习是否能提升对行为策略分布偏移的表征鲁棒性?
- RQ2不同的负样本对生成策略如何影响离线元强化学习中的 OOD 泛化能力?
- RQ3与完整轨迹相比,从单个转移元组学习是否能减少对行为策略特征的记忆?
- RQ4所提出方法是否能优于使用真实任务描述的监督基线方法?
- RQ5负样本采样策略的选择如何影响在分布外行为策略下的性能表现?
主要发现
- 在 Point-Robot 基准测试中,CORRO 在 OOD 行为策略下取得最高平均回报,为 -5.59 ± 0.57,显著优于 FOCAL(-8.64 ± 0.26)和 PEARL(-7.06 ± 0.99)。
- 在 Half-Cheetah-Vel 环境中,CORRO 在 OOD 测试中取得 -42.9 ± 0.7 的表现,显著优于 FOCAL(-208.2)和 PEARL(-35.4 ± 1.8)。
- 在 Point-Robot 中,奖励扰动方法优于生成建模方法,表明方法效果具有任务特异性,尤其在行为策略高度方向性且不重叠时更优。
- “None”负样本采样方法(从不同任务中随机选取转移)在 OOD Half-Cheetah-Vel 中取得 -97.6 的表现,优于 FOCAL(-204.1),表明基于转移级别的学习能显著提升 OOD 泛化能力。
- 将 FOCAL 重新实现并采用 CORRO 的 InfoNCE 损失后,在 OOD Half-Cheetah-Vel 中取得 -208.2 的表现,接近原始 FOCAL,表明仅靠对比损失不足以提升性能——转移级别的编码才是关键。
- 在使用随机探索收集上下文数据的环境中,CORRO 展现出最佳适应性能,证明其在上下文数据由非最优策略收集时仍具备强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。