Skip to main content
QUICK REVIEW

[论文解读] Sample-efficient reinforcement learning using deep Gaussian processes

Charles W. L. Gadd, Markus Heinonen|arXiv (Cornell University)|Nov 2, 2020
Gaussian Processes and Bayesian Inference参考文献 25被引用 4
一句话总结

本文提出了一种基于深度高斯过程(DGP)的模型,通过结合高斯过程的不确定性量化能力与深度学习的表征能力,实现了样本高效的强化学习。该方法在复杂控制任务中实现了快速且稳定的训练——在早期阶段展现出卓越的样本效率,包括仅通过一次交互episode即解决了half-cheetah任务,优于先前的基于GP和基于神经网络的基线方法。

ABSTRACT

Reinforcement learning provides a framework for learning to control which actions to take towards completing a task through trial-and-error. In many applications observing interactions is costly, necessitating sample-efficient learning. In model-based reinforcement learning efficiency is improved by learning to simulate the world dynamics. The challenge is that model inaccuracies rapidly accumulate over planned trajectories. We introduce deep Gaussian processes where the depth of the compositions introduces model complexity while incorporating prior knowledge on the dynamics brings smoothness and structure. Our approach is able to sample a Bayesian posterior over trajectories. We demonstrate highly improved early sample-efficiency over competing methods. This is shown across a number of continuous control tasks, including the half-cheetah whose contact dynamics have previously posed an insurmountable problem for earlier sample-efficient Gaussian process based models.

研究动机与目标

  • 为解决强化学习中的样本效率低下问题,尤其是在成本高昂的真实世界环境中。
  • 结合高斯过程的不确定性感知建模能力与深度神经网络的表征能力。
  • 在非平稳和复杂动力系统中,仅使用极少交互数据即可实现快速且可靠的训练。
  • 克服先前基于GP的模型在复杂任务(如half-cheetah)中因模型容量不足而失效的局限性。
  • 在基准连续控制环境中展示改进的样本效率与鲁棒性。

提出的方法

  • 该方法采用深度高斯过程(DGPs)建模环境动力学,通过多层GP回归器构成分层组合结构。
  • 使用贝叶斯推断计算轨迹的后验分布,实现时间维度上的不确定性传播。
  • 通过结构化核设计,将关于系统平滑性与动力学特性的先验知识融入模型。
  • 提出一种新颖的推断方案,实现对轨迹后验分布的高效近似采样,支持基于模型的规划。
  • 通过深度组合提升模型容量,同时保持严谨的不确定性估计。
  • 与模型预测控制(MPC)集成用于动作选择,利用采样轨迹优化奖励。

实验结果

研究问题

  • RQ1与标准GP和神经网络基线相比,深度高斯过程是否能提升基于模型的强化学习中的样本效率?
  • RQ2深度GP模型是否能有效捕捉如half-cheetah这类接触丰富的环境中复杂的非平滑动力学?
  • RQ3在低数据场景下,融入关于系统平滑性与结构的先验知识是否能增强学习的稳定性和性能?
  • RQ4在多个连续控制基准环境中,该DGP方法在早期学习速度与最终性能方面如何与基线方法比较?
  • RQ5该方法是否能仅通过一次交互episode即实现优异性能,而此前的基于GP的方法则无法做到?

主要发现

  • DGP-MPC方法在初始学习阶段的速度显著快于其他竞争方法,在half-cheetah环境中从第一个episode起即累积正向奖励。
  • 在half-cheetah任务中,GP-MM与GP-DS未能累积任何奖励,而PETS则需要大量额外交互才能达到相近性能。
  • 该方法在前10个episode中表现出一致且较高的平均奖励,学习速度与稳定性均优于所有基线方法。
  • 基于DGP的方法仅需少数episode即实现优异性能,相比PETS及其他基于GP的模型展现出更优的早期样本效率。
  • 即使在复杂且非平稳的动力学环境中,该模型仍能保持稳健的不确定性估计,从而实现从极少数据中可靠规划。
  • 该方法在10次独立随机种子实验中表现稳定,方差较低,表明学习行为具有一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。