Skip to main content
QUICK REVIEW

[论文解读] Sparse Gaussian Process Temporal Difference Learning for Marine Robot Navigation

John D. Martin, Jinkun Wang|arXiv (Cornell University)|Oct 2, 2018
Gaussian Processes and Bayesian Inference被引用 8
一句话总结

该论文提出spgp-sarsa,一种基于稀疏高斯过程时序差分学习的方法,可提升海洋机器人导航的数据效率与预测精度。通过采用新型稀疏近似方法(变分推断)替代基于拒绝采样的方法,该方法仅用极少数据即可实现近似最优性能——在一次真实水下机器人实验中,仅用八次转移便学习到近似最优策略。

ABSTRACT

We present a method for Temporal Difference (TD) learning that addresses several challenges faced by robots learning to navigate in a marine environment. For improved data efficiency, our method reduces TD updates to Gaussian Process regression. To make predictions amenable to online settings, we introduce a sparse approximation with improved quality over current rejection-based sparse methods. We derive the predictive value function posterior and use the moments to obtain a new algorithm for model-free policy evaluation, SPGP-SARSA. With simple changes, we show SPGP-SARSA can be reduced to a model-based equivalent, SPGP-TD. We perform comprehensive simulation studies and also conduct physical learning trials with an underwater robot. Our results show SPGP-SARSA can outperform the state-of-the-art sparse method, replicate the prediction quality of its exact counterpart, and be applied to solve underwater navigation tasks.

研究动机与目标

  • 解决由于传感器数据有限和在线学习约束导致的海洋机器人强化学习中数据稀缺的问题。
  • 通过将时序差分学习重新表述为高斯过程回归,提升无模型策略评估的数据效率。
  • 开发一种避免数据丢弃的稀疏近似方法,相比现有低秩方法减少近似误差。
  • 实现在线、实时的值函数预测,适用于计算与传感资源受限的水下机器人。
  • 在仿真和真实水下机器人实验中,以极少训练数据证明该方法的有效性。

提出的方法

  • 通过将值函数差异建模为真实值函数的噪声观测,将时序差分学习重新表述为高斯过程回归。
  • 使用稀疏伪输入近似(spgp)将计算复杂度从O(N³)降低至O(NM²),其中M ≪ N为支持点数量。
  • 引入变分推断框架,在不丢弃数据的前提下学习稀疏近似,避免边缘似然优化中的不稳定性。
  • 利用稀疏GP的矩推导值函数的预测后验分布,实现不确定性感知的策略评估。
  • 开发spgp-sarsa作为无模型策略评估算法,通过在GP框架内进行时序差分更新来更新值函数估计。
  • 通过引入已知动力学,将spgp-sarsa扩展为模型-based变体spgp-td,提升其在不同学习场景中的适用性。

实验结果

研究问题

  • RQ1稀疏高斯过程回归能否提升海洋机器人导航中时序差分学习的数据效率?
  • RQ2所提出的稀疏近似方法与基于拒绝采样的稀疏化方法相比,在预测精度和优化稳定性方面表现如何?
  • RQ3该方法能否在真实水下机器人环境中,仅用极少数转移次数学习到近似最优导航策略?
  • RQ4该方法在在线、实时机器人学习场景中的计算效率如何?
  • RQ5spgp-sarsa的预测性能与精确GP-TD基线方法及现有最先进稀疏方法相比如何?

主要发现

  • spgp-sarsa在保持计算效率的同时,达到了与精确GP-TD方法相当的预测质量。
  • 在模型选择过程中,该方法在预测精度和稳定性方面优于现有最先进稀疏近似方法。
  • 仅通过物理BlueROV实验中的八次转移,spgp-sarsa即成功学习到近似最优值函数与策略。
  • 在2.8GHz i7处理器上,平均策略更新时间为0.013 ± 7×10⁻⁴秒,证实了其满足实时性要求。
  • 采用变分推断的稀疏近似避免了基于拒绝采样的方法中常见的边缘似然不稳定性。
  • 该方法在应对传感器漂移和水下定位初始不确定性方面表现出鲁棒性,支持在真实世界约束下可靠学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。