Skip to main content
QUICK REVIEW

[论文解读] Provably Efficient Reward-Agnostic Navigation with Linear Value Iteration

Andrea Zanette, Alessandro Lazaric|arXiv (Cornell University)|Aug 18, 2020
Robotic Path Planning Algorithms参考文献 43被引用 13
一句话总结

本文提出了一种可证明高效的、计算上可行的算法,用于无奖励强化学习,采用线性值函数逼近。通过利用低固有贝尔曼误差和无奖励探索框架,该算法在任意线性奖励函数下实现了近似最优策略的PAC样本复杂度边界,即使奖励在事后才被揭示或从探索数据中估计,亦可实现。

ABSTRACT

There has been growing progress on theoretical analyses for provably efficient learning in MDPs with linear function approximation, but much of the existing work has made strong assumptions to enable exploration by conventional exploration frameworks. Typically these assumptions are stronger than what is needed to find good solutions in the batch setting. In this work, we show how under a more standard notion of low inherent Bellman error, typically employed in least-square value iteration-style algorithms, we can provide strong PAC guarantees on learning a near optimal value function provided that the linear space is sufficiently "explorable". We present a computationally tractable algorithm for the reward-free setting and show how it can be used to learn a near optimal policy for any (linear) reward function, which is revealed only once learning has completed. If this reward function is also estimated from the samples gathered during pure exploration, our results also provide same-order PAC guarantees on the performance of the resulting policy for this setting.

研究动机与目标

  • 在低固有贝尔曼误差假设下,开发一种计算高效且统计可靠的强化学习算法,该假设在批量强化学习方法(如LSPI和LSVI)中是标准的。
  • 在不事先知晓奖励的情况下,仅通过单阶段纯探索,实现对任意线性奖励函数的近似最优策略学习。
  • 当奖励在学习后被揭示或从同一探索数据中估计时,为所得策略提供PAC泛化保证。
  • 通过依赖更标准、适合批量处理的假设,克服先前工作中对乐观闭包假设的依赖。

提出的方法

  • 该算法使用无奖励探索阶段,在固定策略下收集轨迹,以确保对状态-动作空间的充分覆盖。
  • 采用带最小二乘估计器的线性值迭代来逼近值函数,以最小化固有贝尔曼误差。
  • 通过特征协方差矩阵的对偶范数推导出一种新颖的探索奖励,实现在无先验奖励知识情况下的高效探索。
  • 该方法确保值函数逼近保持在低维线性空间内,从而实现可计算的优化。
  • 利用集中不等式(如卡方分布和阿兹马-霍夫丁不等式)推导出估计误差和泛化性的高概率边界。
  • 该算法通过避免估计完整转移模型或求解复杂在线优化问题,确保计算上的可处理性。

实验结果

研究问题

  • RQ1在标准低固有贝尔曼误差假设下,能否在不依赖乐观闭包的前提下,实现线性MDP中的可证明高效学习?
  • RQ2能否设计一种计算高效的算法,在单阶段纯探索后,为任意线性奖励函数学习到近似最优策略?
  • RQ3在奖励已知事后和从探索数据中估计两种情况下,此类无奖励学习框架可实现的样本复杂度边界是什么?
  • RQ4该算法的性能如何随特征空间维度和置信水平的变化而变化?

主要发现

  • 该算法实现了PAC样本复杂度边界,其规模与特征空间维度和奖励差距的倒数成正比,与已知下界相比仅相差对数因子。
  • 它首次在低固有贝尔曼误差假设下,于无奖励设置中提供了计算上可行且具有PAC保证的算法,且无需乐观闭包假设。
  • 当奖励从同一探索数据中估计时,所得策略仍能实现与已知真实奖励时同阶的PAC性能保证。
  • 理论分析通过高斯分布和卡方分布变量的集中不等式,建立了值函数估计误差的高概率边界。
  • 该方法确保探索奖励与特征向量的对偶范数成正比,从而实现对状态-动作空间的有效覆盖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。