Skip to main content
QUICK REVIEW

[论文解读] Average-Reward Off-Policy Policy Evaluation with Function Approximation

Shangtong Zhang, Yi Wan|arXiv (Cornell University)|Jan 8, 2021
Reinforcement Learning in Robotics参考文献 57被引用 6
一句话总结

该论文提出了两种新颖的离策略算法——Diff-GQ1 和 Diff-GQ2,用于平均奖励策略评估并结合函数逼近,采用梯度时序差分方法打破致命三联组(deadly triad)。这两种算法是首个在无需密度比估计的前提下,对微分值函数和奖励率估计均能保证收敛的线性函数逼近方法,在实验中表现优于基于密度比的方法。

ABSTRACT

We consider off-policy policy evaluation with function approximation (FA) in average-reward MDPs, where the goal is to estimate both the reward rate and the differential value function. For this problem, bootstrapping is necessary and, along with off-policy learning and FA, results in the deadly triad (Sutton & Barto, 2018). To address the deadly triad, we propose two novel algorithms, reproducing the celebrated success of Gradient TD algorithms in the average-reward setting. In terms of estimating the differential value function, the algorithms are the first convergent off-policy linear function approximation algorithms. In terms of estimating the reward rate, the algorithms are the first convergent off-policy linear function approximation algorithms that do not require estimating the density ratio. We demonstrate empirically the advantage of the proposed algorithms, as well as their nonlinear variants, over a competitive density-ratio-based approach, in a simple domain as well as challenging robot simulation tasks.

研究动机与目标

  • 解决在函数逼近下平均奖励离策略学习中的致命三联组问题,即自举法、离策略数据与函数逼近共同导致发散。
  • 开发首个可证明收敛的线性函数逼近算法,用于估计离策略平均奖励 MDP 中的微分值函数。
  • 设计首个无需估计密度比即可实现收敛的离策略线性函数逼近方法,用于奖励率估计。
  • 在表格设置和非线性函数逼近设置下,对所提算法与具有竞争力的基于密度比的方法 GradientDICE 进行实证评估。

提出的方法

  • 提出 Diff-GQ1 和 Diff-GQ2,通过原始-对偶优化方法将梯度 TD 框架扩展至平均奖励设置。
  • 采用改进的贝尔曼误差目标函数,将微分值函数与奖励率估计整合于单一优化框架中。
  • 采用双时间尺度随机梯度更新:一个用于对偶变量(与贝尔曼误差相关),一个用于原始变量(值函数与奖励率估计)。
  • 在原始变量上引入岭正则化,以确保收敛性与稳定性,尤其在高维函数逼近设置中。
  • 在标准假设下推导出收敛性保证,包括不可约性、非周期性以及特征矩阵性质,确保几乎必然收敛至最优解。
  • 提出一种新颖的 MSPBE(均方投影贝尔曼误差)公式,实现无需密度比估计即可联合估计奖励率与微分值函数。

实验结果

研究问题

  • RQ1能否在不依赖密度比估计的前提下,使平均奖励 MDP 的离策略线性函数逼近实现可证明收敛?
  • RQ2能否成功将折扣设置下的基于梯度的方法适配至平均奖励设置,以打破致命三联组?
  • RQ3在复杂环境中,基于值的离策略算法在奖励率估计方面与基于密度比的方法相比表现如何?
  • RQ4所提方法在非线性函数逼近设置(如神经网络)中是否仍保持稳定性和收敛性?

主要发现

  • 所提的 Diff-GQ1 和 Diff-GQ2 算法是首个可证明收敛的离策略线性函数逼近方法,用于估计平均奖励 MDP 中的微分值函数。
  • 该算法在无需估计密度比的前提下实现了奖励率估计的收敛,相较于先前方法具有关键优势。
  • 在一个简单的马尔可夫链领域中,所提算法在估计精度与稳定性方面优于基于密度比的 GradientDICE 方法。
  • 在具有挑战性的 MuJoCo 机器人仿真任务中,所提算法在多个环境和函数逼近架构(包括神经网络)下均持续优于 GradientDICE。
  • 实证结果表明,Hessian 矩阵 $F$ 为半正定的概率保持较高(例如在 $| ablaackslashmathcal{S}|| ablaackslashmathcal{A}|=100$ 时为 0.93),表明其具有鲁棒性。
  • 即使在高维函数逼近设置下,算法也表现出稳定的训练行为,这在使用神经网络的非线性设置中得到了一致收敛性的验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。