[论文解读] Doubly Robust Off-Policy Actor-Critic: Convergence and Optimality
本文提出 DR-Off-PAC,一种单时间尺度的离策略演员-评论家算法,利用双重稳健策略梯度估计器来降低价值函数和密度比估计误差带来的偏差。该算法在近似误差存在的情况下仍能保持样本复杂度边界的鲁棒性,并实现有限时间收敛,建立了首个针对具有双重稳健最优性的单时间尺度离策略演员-评论家方法的总体样本复杂度分析。
Designing off-policy reinforcement learning algorithms is typically a very challenging task, because a desirable iteration update often involves an expectation over an on-policy distribution. Prior off-policy actor-critic (AC) algorithms have introduced a new critic that uses the density ratio for adjusting the distribution mismatch in order to stabilize the convergence, but at the cost of potentially introducing high biases due to the estimation errors of both the density ratio and value function. In this paper, we develop a doubly robust off-policy AC (DR-Off-PAC) for discounted MDP, which can take advantage of learned nuisance functions to reduce estimation errors. Moreover, DR-Off-PAC adopts a single timescale structure, in which both actor and critics are updated simultaneously with constant stepsize, and is thus more sample efficient than prior algorithms that adopt either two timescale or nested-loop structure. We study the finite-time convergence rate and characterize the sample complexity for DR-Off-PAC to attain an $ε$-accurate optimal policy. We also show that the overall convergence of DR-Off-PAC is doubly robust to the approximation errors that depend only on the expressive power of approximation functions. To the best of our knowledge, our study establishes the first overall sample complexity analysis for a single time-scale off-policy AC algorithm.
研究动机与目标
- 解决离策略强化学习中的分布不匹配问题,其中使用离策略数据进行策略梯度估计常导致不稳定性和高偏差。
- 克服先前离策略演员-评论家方法的局限性,这些方法因价值函数和密度比估计不准确而导致高偏差。
- 为无限时域折扣 MDP 提出一种新型双重稳健策略梯度估计器,当四个干扰函数中的任意两个被准确估计时,可减少偏差。
- 设计一种无模型、单时间尺度的评论家架构,以递归方式高效估计无限时域离策略设置下的干扰函数。
- 建立首个针对具有双重稳健收敛保证的单时间尺度离策略演员-评论家算法的有限时间样本复杂度分析。
提出的方法
- 提出一种双重稳健策略梯度估计器,结合价值函数和密度比估计,确保当四个干扰函数中的任意两个准确时,偏差得以减少。
- 引入一种递归方法,使评论家能够使用时序差分学习,在无限时域离策略设置下递归估计干扰函数(如密度比、Q值及其导数)。
- 设计一种单时间尺度的演员-评论家框架,其中演员和评论家使用恒定学习率同时更新,相较于双时间尺度或嵌套循环方法,提升了样本效率。
- 通过使用双重稳健估计器,结合重要性加权和价值函数校正,制定策略梯度更新,以校正分布偏移。
- 通过分析评论家估计误差、演员更新误差和采样方差之间的相互作用,推导出估计误差和收敛性的理论边界。
- 采用李雅普诺夫风格分析,界定最优性差距,并表明收敛速率依赖于时间的平方根和数据集大小的倒数,且残余偏差项在干扰估计准确时会消失。
实验结果
研究问题
- RQ1能否将双重稳健策略梯度估计器有效扩展到无模型离策略设置下的无限时域折扣 MDP?
- RQ2在单时间尺度演员-评论家框架中引入双重稳健估计器后,是否能保持整体收敛的双重稳健性,即最优性差距是否对近似误差保持鲁棒?
- RQ3具有双重稳健估计的单时间尺度离策略演员-评论家算法的有限时间样本复杂度是多少?
- RQ4所提算法的收敛速率如何随时间 T 和数据集大小 N 变化?
- RQ5所提评论家架构能否在无限时域离策略设置下递归且高效地估计所需的干扰函数(如密度比和价值函数导数)?
主要发现
- 所提出的 DR-Off-PAC 算法实现了有限时间收敛,其最优性差距被界定为 $\Theta(1/\sqrt{T}) + \Theta(1/\sqrt{N}) + \Theta(\epsilon_{\rho}\epsilon_{d_q} + \epsilon_{d_\rho}\epsilon_q + \epsilon_{\rho}\epsilon_q)$,其中 $T$ 为迭代次数,$N$ 为数据集大小。
- 该算法的收敛具有双重稳健性:若四个干扰函数(密度比、价值函数及其导数)中的任意两个被准确估计,则最优性差距将消失。
- 首次在单时间尺度离策略演员-评论家方法背景下建立了 DR-Off-PAC 的样本复杂度,其在标准假设下收敛速率为 $O(1/\sqrt{T})$。
- 通过利用双重稳健梯度估计器,该算法保持了稳定性和低偏差,减少了对单个干扰估计器准确性的依赖。
- 理论分析证实,整体收敛误差取决于干扰函数估计误差的乘积,即使各组成部分不完美,也能确保鲁棒性。
- 递归评论家设计实现了所有必需干扰函数在无限时域设置下的高效、无模型估计,支持该算法的实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。