[论文解读] Stochastic Primal-Dual Q-Learning
本文提出了一种新型无模型、离策略强化学习算法——随机原始-对偶Q-learning(Stochastic Primal-Dual Q-Learning, SPD Q-learning),将Q-learning建模为一个随机原始-对偶优化问题。该方法在状态-动作分布随时间变化的情况下仍能保证收敛,并具备可证明的收敛速率,以概率 $1-\delta$ 实现 $\varepsilon$-次优策略,样本复杂度为 $\mathcal{O}\left(\frac{|\mathcal{S}|^{6}|\mathcal{A}|^{4}}{\zeta^{4}(1-\alpha)^{6}}\frac{1}{\varepsilon^{2}}\ln\left(\frac{1}{\delta}\right)\right)$。该方法无需重要性采样,即可从原始解和对偶解中恢复策略。
In this work, we present a new model-free and off-policy reinforcement learning (RL) algorithm, that is capable of finding a near-optimal policy with state-action observations from arbitrary behavior policies. Our algorithm, called the stochastic primal-dual Q-learning (SPD Q-learning), hinges upon a new linear programming formulation and a dual perspective of the standard Q-learning. In contrast to previous primal-dual RL algorithms, the SPD Q-learning includes a Q-function estimation step, thus allowing to recover an approximate policy from the primal solution as well as the dual solution. We prove a first-of-its-kind result that the SPD Q-learning guarantees a certain convergence rate, even when the state-action distribution is time-varying but sub-linearly converges to a stationary distribution. Numerical experiments are provided to demonstrate the off-policy learning abilities of the proposed algorithm in comparison to the standard Q-learning.
研究动机与目标
- 为弥合离策略强化学习中理论与实践之间的差距,实现从真实世界轨迹中可靠学习策略。
- 设计一种无需重要性采样的无模型、离策略强化学习算法,区别于标准离策略方法。
- 在非平稳、时变的状态-动作分布下,为收敛性和样本复杂度提供理论保证。
- 将Q函数估计与原始-对偶优化统一,使得从原始解和对偶解中均可恢复策略。
- 首次为在次线性收敛状态-动作分布下运行的离策略强化学习提供收敛速率保证。
提出的方法
- 将贝尔曼方程表述为线性规划(LP)问题,并推导其拉格朗日对偶问题,从而建立原始-对偶优化框架。
- 提出一种随机原始-对偶算法,利用任意行为策略的在线样本同时更新原始变量(Q函数)和对偶变量(拉格朗日乘子)。
- 引入Q函数估计步骤,使近似策略可直接从原始解中恢复。
- 采用递减步长规则和随机次梯度,以处理采样噪声并确保收敛。
- 采用鞍点问题形式化联合优化拉格朗日函数,利用对偶性确保收敛至最优策略。
- 使用鞅差序列和集中不等式分析算法,推导出样本复杂度边界。
实验结果
研究问题
- RQ1能否设计一种无模型、离策略的强化学习算法,在状态-动作分布随时间变化且无需重要性采样的情况下保证收敛?
- RQ2能否构建Q-learning的原始-对偶形式,使得原始解和对偶解均能恢复出可执行策略?
- RQ3此类原始-对偶Q-learning算法在非平稳采样下的理论收敛速率如何?
- RQ4样本复杂度如何随状态空间和动作空间大小、折扣因子以及期望精度变化?
- RQ5在随机采样下,对偶间隙能否以高概率被有界?
主要发现
- SPD Q-learning算法即使在状态-动作分布随时间变化但次线性收敛至平稳分布时,仍能保证收敛,并具备可证明的收敛速率。
- 该算法以概率 $1-\delta$ 实现对偶间隙小于或等于 $\varepsilon$,所需迭代次数为 $\mathcal{O}\left(\frac{|\mathcal{S}|^{4}|\mathcal{A}|^{4}}{\zeta^{4}(1-\alpha)^{4}}\frac{1}{\varepsilon^{2}}\ln\left(\frac{1}{\delta}\right)\right)$。
- 以至少 $1-\delta$ 的概率,可通过 $\mathcal{O}\left(\frac{|\mathcal{S}|^{6}|\mathcal{A}|^{4}}{\zeta^{4}(1-\alpha)^{6}}\frac{1}{\varepsilon^{2}}\ln\left(\frac{1}{\delta}\right)\right)$ 次迭代恢复出 $\varepsilon$-次优策略。
- 该方法可从原始解和对偶解中同时恢复策略,无需额外的策略优化步骤。
- 收敛性分析建立了非渐近样本复杂度边界,其依赖于状态空间和动作空间的大小、折扣因子以及通过 $\zeta$ 表征的分布混合速率。
- 数值实验验证了SPD Q-learning在非均匀行为策略下的离策略学习能力,其性能相比标准Q-learning表现出更强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。