[论文解读] Meta-Reinforcement Learning Robust to Distributional Shift via Model Identification and Experience Relabeling
该论文提出 MIER,一种元强化学习算法,通过使用模型识别快速适应动力学和奖励模型(基于梯度下降),随后通过经验重标记生成合成数据以微调策略,从而提升对分布外变化的鲁棒性。在 HalfCheetah 和 Ant 环境中,MIER 在分布外任务上的表现优于 MAML、PEARL 和 GrBAL,尤其在具有挑战性的动力学和奖励外推设置下表现更优。
Reinforcement learning algorithms can acquire policies for complex tasks autonomously. However, the number of samples required to learn a diverse set of skills can be prohibitively large. While meta-reinforcement learning methods have enabled agents to leverage prior experience to adapt quickly to new tasks, their performance depends crucially on how close the new task is to the previously experienced tasks. Current approaches are either not able to extrapolate well, or can do so at the expense of requiring extremely large amounts of data for on-policy meta-training. In this work, we present model identification and experience relabeling (MIER), a meta-reinforcement learning algorithm that is both efficient and extrapolates well when faced with out-of-distribution tasks at test time. Our method is based on a simple insight: we recognize that dynamics models can be adapted efficiently and consistently with off-policy data, more easily than policies and value functions. These dynamics models can then be used to continue training policies and value functions for out-of-distribution tasks without using meta-reinforcement learning at all, by generating synthetic experience for the new task.
研究动机与目标
- 解决元强化学习方法在元测试阶段泛化到分布外任务时的局限性。
- 开发一种样本高效的元强化学习方法,避免使用在线策略元训练,从而实现离策略训练以提升数据效率。
- 通过利用学习到的动力学和奖励模型生成合成经验,实现对分布外任务的一致适应。
- 将模型的元训练与策略微调解耦,使标准离策略强化学习能够基于重标记数据对策略进行微调。
提出的方法
- 模型识别采用基于梯度的监督元学习,推断出编码任务特定动力学和奖励函数的上下文变量,从而通过少量梯度步骤实现快速适应。
- 策略基于适配后的上下文变量进行训练,采用标准离策略强化学习,避免了复杂元强化学习策略适应过程。
- 经验重标记利用适配后的动力学模型,为元训练任务中所有先前收集的转移状态预测下一状态和奖励,从而生成合成经验。
- 利用重标记生成的合成数据通过离策略强化学习对策略进行微调,即使新任务超出元训练分布,也能实现持续改进。
- 该方法结合了模型识别与经验重标记:前者实现快速任务适应,后者实现对分布外任务的鲁棒泛化。
- 通过在重标记数据上使用标准强化学习训练策略,避免了在线策略元训练,从而提升了样本效率与可扩展性。
实验结果
研究问题
- RQ1元强化学习方法是否能在不依赖在线策略元训练的前提下,实现对分布外任务的鲁棒泛化?
- RQ2动力学和奖励模型是否能通过离策略数据一致地适应,从而实现对未见任务的可靠策略微调?
- RQ3与标准元强化学习方法相比,使用模型预测的转移状态和奖励进行经验重标记,是否能提升策略在分布外任务上的性能?
- RQ4在动力学和奖励分布偏移的外推任务中,模型识别与经验重标记的结合方法相较于 MAML、PEARL 和 GrBAL 的性能表现如何?
主要发现
- 在 HalfCheetah-Velocity 和 Ant-Direction 环境中,MIER 在分布外任务上的表现优于 MAML、PEARL 和 GrBAL,尤其在奖励函数外推任务中表现更优。
- 在 Cheetah-Negated-Joints 任务中,仅使用模型识别的 MIER-wR 显著优于 PEARL 和 MAML,而完整 MIER(含重标记)进一步提升了性能。
- 在更具挑战性的 Ant-Negated-Joints 环境中,MIER-wR 的性能与 PEARL 相当,而加入重标记的 MIER 表现更优,证明了经验重标记的有效性。
- 随着任务偏离训练分布的程度增加,所有方法的性能均下降,但 MIER 在所有难度级别的验证任务中始终保持更优的性能。
- 消融实验表明,经验重标记对分布外泛化至关重要,因为 MIER-wR(无重标记)在困难任务上的表现劣于完整 MIER。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。