[论文解读] More Efficient Off-Policy Evaluation through Regularized Targeted Learning
本文提出了 RLTMLE,一种用于强化学习中离策略评估的正则化目标最大似然估计器,结合了双重稳健估计与通过交叉验证和正则化实现的方差减少。该方法在多种环境和模型误设程度下均表现出优越性能,始终优于现有方法,同时保持了 $O_P(1/\sqrt{n})$ 的收敛速率和渐近正态性。
We study the problem of off-policy evaluation (OPE) in Reinforcement Learning (RL), where the aim is to estimate the performance of a new policy given historical data that may have been generated by a different policy, or policies. In particular, we introduce a novel doubly-robust estimator for the OPE problem in RL, based on the Targeted Maximum Likelihood Estimation principle from the statistical causal inference literature. We also introduce several variance reduction techniques that lead to impressive performance gains in off-policy evaluation. We show empirically that our estimator uniformly wins over existing off-policy evaluation methods across multiple RL environments and various levels of model misspecification. Finally, we further the existing theoretical analysis of estimators for the RL off-policy estimation problem by showing their $O_P(1/\sqrt{n})$ rate of convergence and characterizing their asymptotic distribution.
研究动机与目标
- 通过统计因果推断方法改进强化学习中离策略评估(OPE)的效率与鲁棒性。
- 弥合强化学习与因果推断中目标最大似然估计(TMLE)之间的差距。
- 开发方差减少技术——尤其是交叉验证与正则化——以提升估计器性能。
- 推导马尔可夫决策过程(MDP)中策略价值的高效影响函数(EIF),建立理论最优性。
- 通过实证结果证明,所提出的 RLTMLE 估计器在多种环境和模型误设程度下均一致优于现有 OPE 方法。
提出的方法
- 将纵向目标最大似然估计器(LTMLE)适配至 MDP 中的离策略评估问题。
- 推导策略价值的高效影响函数(EIF),从而可构建达到半参数效率界限的估计器。
- 应用基于交叉验证的样本分割方法,对整个数据集上的 Q 函数估计值进行平均,以降低估计风险。
- 引入正则化技术——包括 MAGIC 集成方法——以提升 LTMLE 估计器的稳定性和降低方差。
- 在双重稳健框架中结合基于模型的(直接方法)与重要性采样组件,以确保偏差减少。
- 采用正则化、基于交叉验证的 LTMLE 估计器(RLTMLE),整合多个正则化估计器以提升性能。
实验结果
研究问题
- RQ1目标最大似然估计能否被有效适配至强化学习中的离策略评估,以提升估计器的效率与鲁棒性?
- RQ2在马尔可夫决策过程(MDP)中,策略价值的高效影响函数(EIF)是什么?它如何用于构建最优估计器?
- RQ3如何利用基于交叉验证与正则化技术来降低方差并提升离策略评估中的有限样本性能?
- RQ4所提出的 RLTMLE 估计器是否实现了预期的 $O_P(1/\sqrt{n})$ 收敛速率与渐近正态性,符合半参数理论?
- RQ5RLTMLE 估计器是否在多种强化学习环境和不同模型误设程度下均一致优于现有 OPE 方法?
主要发现
- 所提出的 RLTMLE 估计器在包括 ModelWin、ModelFail 和 Gridworld 在内的多个强化学习环境中,始终优于所有对比的离策略评估方法。
- RLTMLE 估计器实现了 $O_P(1/\sqrt{n})$ 的收敛速率与渐近正态性,证实了其理论最优性。
- 基于交叉验证的 Q 函数平均方法相比标准样本分割,将估计风险降低了常数因子。
- 引入正则化技术——尤其是 MAGIC 集成方法——显著提升了在模型误设情况下的估计器稳定性与性能。
- 本文首次明确推导出离策略评估问题中策略价值的高效影响函数(EIF),从而可构建半参数高效估计器。
- 实证结果表明,即使在模型误设或行为策略与评估策略显著不同时,RLTMLE 也能在所有测试环境中保持低偏差与低方差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。