Skip to main content
QUICK REVIEW

[论文解读] Stochastic Primal-Dual Q-Learning

N. Jeong, Donghwan Lee|arXiv (Cornell University)|Oct 18, 2018
Reinforcement Learning in Robotics参考文献 26被引用 8
一句话总结

本文提出了一种新型无模型、离策略强化学习算法——随机原始-对偶Q-learning(Stochastic Primal-Dual Q-Learning, SPD Q-learning),将Q-learning建模为一个随机原始-对偶优化问题。该方法在状态-动作分布随时间变化的情况下仍能保证收敛,并具备可证明的收敛速率,以概率 $1-\delta$ 实现 $\varepsilon$-次优策略,样本复杂度为 $\mathcal{O}\left(\frac{|\mathcal{S}|^{6}|\mathcal{A}|^{4}}{\zeta^{4}(1-\alpha)^{6}}\frac{1}{\varepsilon^{2}}\ln\left(\frac{1}{\delta}\right)\right)$。该方法无需重要性采样,即可从原始解和对偶解中恢复策略。

ABSTRACT

In this work, we present a new model-free and off-policy reinforcement learning (RL) algorithm, that is capable of finding a near-optimal policy with state-action observations from arbitrary behavior policies. Our algorithm, called the stochastic primal-dual Q-learning (SPD Q-learning), hinges upon a new linear programming formulation and a dual perspective of the standard Q-learning. In contrast to previous primal-dual RL algorithms, the SPD Q-learning includes a Q-function estimation step, thus allowing to recover an approximate policy from the primal solution as well as the dual solution. We prove a first-of-its-kind result that the SPD Q-learning guarantees a certain convergence rate, even when the state-action distribution is time-varying but sub-linearly converges to a stationary distribution. Numerical experiments are provided to demonstrate the off-policy learning abilities of the proposed algorithm in comparison to the standard Q-learning.

研究动机与目标

  • 为弥合离策略强化学习中理论与实践之间的差距,实现从真实世界轨迹中可靠学习策略。
  • 设计一种无需重要性采样的无模型、离策略强化学习算法,区别于标准离策略方法。
  • 在非平稳、时变的状态-动作分布下,为收敛性和样本复杂度提供理论保证。
  • 将Q函数估计与原始-对偶优化统一,使得从原始解和对偶解中均可恢复策略。
  • 首次为在次线性收敛状态-动作分布下运行的离策略强化学习提供收敛速率保证。

提出的方法

  • 将贝尔曼方程表述为线性规划(LP)问题,并推导其拉格朗日对偶问题,从而建立原始-对偶优化框架。
  • 提出一种随机原始-对偶算法,利用任意行为策略的在线样本同时更新原始变量(Q函数)和对偶变量(拉格朗日乘子)。
  • 引入Q函数估计步骤,使近似策略可直接从原始解中恢复。
  • 采用递减步长规则和随机次梯度,以处理采样噪声并确保收敛。
  • 采用鞍点问题形式化联合优化拉格朗日函数,利用对偶性确保收敛至最优策略。
  • 使用鞅差序列和集中不等式分析算法,推导出样本复杂度边界。

实验结果

研究问题

  • RQ1能否设计一种无模型、离策略的强化学习算法,在状态-动作分布随时间变化且无需重要性采样的情况下保证收敛?
  • RQ2能否构建Q-learning的原始-对偶形式,使得原始解和对偶解均能恢复出可执行策略?
  • RQ3此类原始-对偶Q-learning算法在非平稳采样下的理论收敛速率如何?
  • RQ4样本复杂度如何随状态空间和动作空间大小、折扣因子以及期望精度变化?
  • RQ5在随机采样下,对偶间隙能否以高概率被有界?

主要发现

  • SPD Q-learning算法即使在状态-动作分布随时间变化但次线性收敛至平稳分布时,仍能保证收敛,并具备可证明的收敛速率。
  • 该算法以概率 $1-\delta$ 实现对偶间隙小于或等于 $\varepsilon$,所需迭代次数为 $\mathcal{O}\left(\frac{|\mathcal{S}|^{4}|\mathcal{A}|^{4}}{\zeta^{4}(1-\alpha)^{4}}\frac{1}{\varepsilon^{2}}\ln\left(\frac{1}{\delta}\right)\right)$。
  • 以至少 $1-\delta$ 的概率,可通过 $\mathcal{O}\left(\frac{|\mathcal{S}|^{6}|\mathcal{A}|^{4}}{\zeta^{4}(1-\alpha)^{6}}\frac{1}{\varepsilon^{2}}\ln\left(\frac{1}{\delta}\right)\right)$ 次迭代恢复出 $\varepsilon$-次优策略。
  • 该方法可从原始解和对偶解中同时恢复策略,无需额外的策略优化步骤。
  • 收敛性分析建立了非渐近样本复杂度边界,其依赖于状态空间和动作空间的大小、折扣因子以及通过 $\zeta$ 表征的分布混合速率。
  • 数值实验验证了SPD Q-learning在非均匀行为策略下的离策略学习能力,其性能相比标准Q-learning表现出更强的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。