Skip to main content
QUICK REVIEW

[论文解读] Robust Reinforcement Learning using Least Squares Policy Iteration with Provable Performance Guarantees

Kishan Panaganti, Dileep Kalathil|arXiv (Cornell University)|Jun 20, 2020
Reinforcement Learning in Robotics参考文献 32被引用 12
一句话总结

本文提出了一种无模型的强化学习算法——鲁棒最小二乘策略迭代(RLSPI), 用于具有大规模状态空间的鲁棒马尔可夫决策过程(RMDPs),采用线性函数逼近。该方法引入了一种可证明收敛的鲁棒最小二乘策略评估(RLSPE)算法,并建立了所学习策略次优性的 $L_2$-范数上界,展示了在 MountainCar 和 FrozenLake8x8 等基准环境中的参数不确定性下具备鲁棒性能。

ABSTRACT

This paper addresses the problem of model-free reinforcement learning for Robust Markov Decision Process (RMDP) with large state spaces. The goal of the RMDP framework is to find a policy that is robust against the parameter uncertainties due to the mismatch between the simulator model and real-world settings. We first propose the Robust Least Squares Policy Evaluation algorithm, which is a multi-step online model-free learning algorithm for policy evaluation. We prove the convergence of this algorithm using stochastic approximation techniques. We then propose Robust Least Squares Policy Iteration (RLSPI) algorithm for learning the optimal robust policy. We also give a general weighted Euclidean norm bound on the error (closeness to optimality) of the resulting policy. Finally, we demonstrate the performance of our RLSPI algorithm on some standard benchmark problems.

研究动机与目标

  • 解决大规模状态空间下无模型鲁棒强化学习缺乏理论保证的问题。
  • 开发一种基于学习的策略迭代框架,确保在仿真器与现实世界不匹配的参数不确定性下具备鲁棒性。
  • 为 RMDPs 中的策略评估与策略迭代提供可证明的收敛性与性能界。
  • 通过线性函数逼近实现可扩展的鲁棒策略学习,同时保持理论严谨性。
  • 在环境参数扰动变化下,于标准基准环境中展示鲁棒性。

提出的方法

  • 提出鲁棒最小二乘策略评估(RLSPE(λ)),一种基于线性函数逼近的多步、在线、无模型算法,用于在 RMDP 不确定性下进行策略评估。
  • 采用随机逼近技术,在一般条件下证明 RLSPE(λ) 的收敛性。
  • 提出鲁棒最小二乘策略迭代(RLSPI),一种集成 RLSPE(λ) 的鲁棒策略学习策略迭代框架。
  • 推导出 RLSPI 任意迭代步骤中策略误差(与最优性接近程度)的一般加权欧几里得范数上界。
  • 采用球形不确定性集来建模环境中参数扰动,捕捉仿真器与真实世界之间的不匹配。
  • 采用线性基函数进行函数逼近,以确保在大规模状态空间中具备可扩展性与解析可处理性。

实验结果

研究问题

  • RQ1能否为 RMDPs 开发一种具备可证明收敛性与性能保证的无模型、在线且可扩展的策略迭代算法?
  • RQ2如何在大规模状态空间中通过函数逼近实现鲁棒策略评估,同时保持理论严谨性?
  • RQ3在不确定性下通过鲁棒策略迭代学习的策略,其次优性的理论界是什么?
  • RQ4与非鲁棒基线方法相比,所提算法在标准强化学习环境中面对参数扰动时表现如何?
  • RQ5在质量、摩擦和动作噪声等环境参数变化下,策略的鲁棒性是否能够保持?

主要发现

  • RLSPE(λ) 算法在随机逼近条件下收敛,确保了在不确定性存在下的稳定策略评估。
  • RLSPI 算法实现了所学策略相对于最优鲁棒策略的可证明 $L_2$-范数误差上界。
  • 在 MountainCar 环境中,RLSPI 在 max_speed 和 power 的扰动下仍保持稳定性能,而 LSPI 显著退化。
  • 在 FrozenLake8x8 环境中,RLSPI 对随机动作概率增加表现出鲁棒性,在到达目标的时间与成功率上均优于非鲁棒方法。
  • 在多种环境(包括 CartPole、Acrobot 和 MountainCar)中,RLSPI 在不同参数偏差下性能保持一致。
  • 该算法表明,即使不调整不确定性半径 $r$ 的超参数,也可通过线性函数逼近与理论保证实现鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。