[论文解读] Accountable Off-Policy Evaluation With Kernel Bellman Statistics
本文提出了一种基于核贝尔曼统计的变分框架,用于可解释的离策略评估,通过构建紧密且可证明的置信区间,无需已知行为策略且避免高方差问题。通过在再生核希尔伯特空间(RKHS)内对基于核贝尔曼损失边界的可行Q函数集合进行优化,该方法实现了计算高效的高置信度边界,并支持对现有估计器的事后诊断,其在稳定性和准确性上优于传统重要性采样方法。
We consider off-policy evaluation (OPE), which evaluates the performance of a new policy from observed data collected from previous experiments, without requiring the execution of the new policy. This finds important applications in areas with high execution cost or safety concerns, such as medical diagnosis, recommendation systems and robotics. In practice, due to the limited information from off-policy data, it is highly desirable to construct rigorous confidence intervals, not just point estimation, for the policy performance. In this work, we propose a new variational framework which reduces the problem of calculating tight confidence bounds in OPE into an optimization problem on a feasible set that catches the true state-action value function with high probability. The feasible set is constructed by leveraging statistical properties of a recently proposed kernel Bellman loss (Feng et al., 2019). We design an efficient computational approach for calculating our bounds, and extend it to perform post-hoc diagnosis and correction for existing estimators. Empirical results show that our method yields tight confidence intervals in different settings.
研究动机与目标
- 解决重要性采样在离策略评估中的局限性,如高方差和对已知行为策略的依赖。
- 利用离策略数据构建严格且紧密的策略性能估计置信区间。
- 通过同一框架实现对现有离策略估计器的事后诊断与修正。
- 通过避免密度比估计,克服长时域MDP中的时域诅咒问题。
- 提供一种与行为策略无关的方法,无需显式知晓行为策略。
提出的方法
- 将离策略评估建模为一个在包含真实Q函数的高概率可行Q函数集合上的优化问题。
- 使用核贝尔曼损失(Feng et al., 2019)定义统计约束,以限制候选Q函数与真实贝尔曼方程的偏差。
- 在再生核希尔伯特空间(RKHS)内对Q函数施加范数约束,以确保计算可处理性。
- 通过随机特征近似核,实现基于有限维参数化的高效优化。
- 通过在受限可行集合上最大化/最小化回报泛函,求解期望回报的上下界。
- 通过在预训练Q函数估计周围施加约束,将框架扩展至事后分析。
实验结果
研究问题
- RQ1我们能否在不依赖已知行为策略的情况下,构建紧密且可证明的置信区间用于离策略评估?
- RQ2如何利用基于核的统计约束,确保真实Q函数以高概率包含在可行集合中?
- RQ3所提方法能否在高方差或长时域设置下,实现比重要性采样更紧的置信边界?
- RQ4是否可能使用同一变分框架对现有离策略估计器进行事后诊断与修正?
- RQ5该方法在不同控制基准上,针对不同程度的策略偏离,其实际表现如何?
主要发现
- 与基于重要性采样的方法相比,该方法在高方差环境下显著实现了更紧的置信区间。
- 该框架提供了对真实策略价值的可证明高置信度边界,并具有包含概率的理论保证。
- 在控制基准上的实证结果表明,该方法在多样化环境中均能产生可靠且狭窄的置信区间。
- 通过该框架进行的事后修正能成功识别并校正现有估计器中的偏差,当估计Q函数偏离真实值时尤为有效。
- 即使行为策略未知或为多种策略的混合,该方法仍保持鲁棒性,避免了密度比估计的需求。
- 理论分析表明,由随机特征核化引入的近似误差是有界的,并随样本量增加而减小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。