Skip to main content
QUICK REVIEW

[论文解读] A New Representation of Successor Features for Transfer across Dissimilar Environments

Majid Abdolshah, Hung Lê|arXiv (Cornell University)|Jul 18, 2021
Gaussian Processes and Bayesian Inference被引用 4
一句话总结

本文提出了一种基于高斯过程的后续特征表示方法,可在环境动力学和奖励函数差异较大的强化学习任务之间实现高效的迁移学习。通过将源环境的后续特征建模为对目标特征的噪声观测,该方法在基准任务上实现了比基线方法更快的收敛速度和更优的性能,同时提供了策略误差和收敛性的理论边界。

ABSTRACT

Transfer in reinforcement learning is usually achieved through generalisation across tasks. Whilst many studies have investigated transferring knowledge when the reward function changes, they have assumed that the dynamics of the environments remain consistent. Many real-world RL problems require transfer among environments with different dynamics. To address this problem, we propose an approach based on successor features in which we model successor feature functions with Gaussian Processes permitting the source successor features to be treated as noisy measurements of the target successor feature function. Our theoretical analysis proves the convergence of this approach as well as the bounded error on modelling successor feature functions with Gaussian Processes in environments with both different dynamics and rewards. We demonstrate our method on benchmark datasets and show that it outperforms current baselines.

研究动机与目标

  • 解决在源任务与目标任务的环境动力学和奖励函数均不同时,强化学习中迁移学习的挑战。
  • 克服现有后续特征方法在不同环境中假设动力学一致性的局限性。
  • 开发一个可泛化的框架,利用源任务的先验知识,加速在动力学差异较大的新环境中的学习。
  • 在环境动力学发生变化时,为目标环境中策略估计的收敛性和误差边界提供理论保证。
  • 在具有不同复杂度水平的多样化强化学习基准环境中,实证验证所提方法优于现有基线方法。

提出的方法

  • 使用高斯过程(GPs)对后续特征函数进行建模,将源环境的后续特征视为对目标函数的噪声测量。
  • 将源环境后续特征的分布作为在高斯过程框架中学习目标后续特征函数的先验。
  • 将目标后续特征函数表述为源特征的噪声实现,从而实现对动力学变化的不确定性感知适应。
  • 应用广义策略改进(GPI)来利用学习到的后续特征估计目标环境中的动作价值函数。
  • 在每一步中将源和目标的经验数据整合到高斯过程模型中,实现增量式学习与适应。
  • 利用高斯过程的预测方差指导探索,提升在目标环境中适应过程中的样本效率。

实验结果

研究问题

  • RQ1当环境动力学存在显著差异时,后续特征能否在不同环境中有效迁移并保持性能?
  • RQ2当目标环境的动力学与源环境不同时,如何对目标环境中后续特征的不确定性进行建模?
  • RQ3当从源环境向动力学不同的目标环境迁移最优策略时,可建立怎样的误差边界?
  • RQ4使用基于高斯过程的后续特征先验是否能实现新环境中更快的收敛速度和更高的样本效率?
  • RQ5在同时存在动力学和奖励变化的环境中,所提方法与现有后续特征迁移方法相比,其性能表现如何?

主要发现

  • 在包含10个物体的网格世界环境中,所提方法在收敛速度和平均累积奖励方面均优于FSF和LPSF基线方法。
  • 在CartPole-v0环境中,当摆杆长度从0.5米更改为3.0米时,该方法在性能上优于LPSF和FSF,展现出对动力学变化的鲁棒性。
  • 在FSF基准环境中,当存在5%的转移噪声和随机终止状态时,该方法优于LPSF,并在初始学习阶段展现出优于FSF的适应能力。
  • 即使在动力学显著不同的情况下,基于高斯过程的模型仍能实现有效的迁移,表现为所有环境中更快的收敛速度和更高的最终回报。
  • 理论分析证实了该方法的收敛性,并为从目标后续特征导出的策略误差提供了上界。
  • 通过将源任务的后续特征作为先验,该方法实现了更高的样本效率,减少了目标环境中所需的交互次数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。