[论文解读] From Importance Sampling to Doubly Robust Policy Gradient
本文提出一个统一框架,从离策略评估(OPE)技术,特别是双重稳健(DR)估计器,推导出策略梯度(PG)估计器。通过将基于DR的值估计器应用有限差分,作者推导出一种通用的PG形式,该形式涵盖最先进的方差缩减方法,并在确定性MDP中实现接近Cramér-Rao下界的更低方差。
We show that on-policy policy gradient (PG) and its variance reduction variants can be derived by taking finite difference of function evaluations supplied by estimators from the importance sampling (IS) family for off-policy evaluation (OPE). Starting from the doubly robust (DR) estimator (Jiang & Li, 2016), we provide a simple derivation of a very general and flexible form of PG, which subsumes the state-of-the-art variance reduction technique (Cheng et al., 2019) as its special case and immediately hints at further variance reduction opportunities overlooked by existing literature. We analyze the variance of the new DR-PG estimator, compare it to existing methods as well as the Cramer-Rao lower bound of policy gradient, and empirically show its effectiveness.
研究动机与目标
- 揭示策略梯度与离策略重要性采样技术之间深层的理论联系。
- 通过对接收双重稳健(DR)OPE估计器应用有限差分,推导出一种通用且灵活的策略梯度估计器。
- 通过利用DR估计器的附加信息和结构特性,实现更低的策略梯度估计方差。
- 证明所提出的DR-PG估计器在确定性MDP中接近策略梯度方差的Cramér-Rao下界。
提出的方法
- 策略梯度被定义为期望回报的有限差分,其中回报使用重要性采样(IS)族中的任意方法进行估计。
- 采用Jiang & Li (2016)提出的双重稳健(DR)估计器作为构建新型通用策略梯度估计器的基础。
- 该方法同时结合基于模型的值估计和重要性加权校正,从而对任一组件中的误差具有鲁棒性。
- 所得的DR-PG估计器包含轨迹级控制变量子,并通过$\nabla_{\bm{\theta}}\tilde{Q}$和$\tilde{G}_2$项支持梯度依赖性校正。
- 该框架自然地涵盖先前方法,包括Cheng et al. (2019)的轨迹级控制变量子,作为特例。
- 该方法通过实际改进实现,如$\theta = 0.9$、$\rho_{[0:t]}$以及自举值估计器$\tilde{V}$、$\tilde{Q}$。
实验结果
研究问题
- RQ1是否可以系统地从离策略评估估计器,特别是双重稳健估计器,推导出策略梯度估计?
- RQ2基于DR的策略梯度估计器是否比现有最先进的方法具有更低的方差?
- RQ3所提出的框架能否揭示先前工作中被忽略的新方差缩减机会?
- RQ4在确定性MDP中,DR-PG估计器的方差与Cramér-Rao下界有多接近?
- RQ5梯度依赖性校正和附加信息在提升估计器效率方面起到什么作用?
主要发现
- DR-PG估计器的方差显著低于基线方法,包括逐步重要性采样和状态动作依赖基线。
- 所提出的DR-PG估计器将Cheng et al. (2019)的最先进方法作为特例涵盖,证实了其通用性和灵活性。
- DR-PG估计器的方差在确定性MDP中被证明接近Cramér-Rao下界,表明其接近最优效率。
- 包含梯度项$\nabla_{\bm{\theta}}\tilde{Q}$和$\tilde{G}_2$的引入,使方差进一步降低,超越了现有控制变量子技术。
- 实证结果证实,DR-PG估计器在多个环境中均表现出更高的样本效率和更强的方差缩减能力,优于所有基线。
- 该方法表明,IS与PG之间的联系并非表面现象,而是基础性联系——使得方差缩减PG估计器的统一推导与分析成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。