Skip to main content
QUICK REVIEW

[论文解读] Conformal Off-Policy Prediction in Contextual Bandits

Muhammad Faaiz Taufiq, Jean-François Ton|arXiv (Cornell University)|Jun 9, 2022
Advanced Bandit Algorithms Research被引用 4
一句话总结

本文提出了一种名为COPP(Conformal Off-Policy Prediction)的新方法,用于在使用观测数据的情况下,针对上下文Bandit中的目标策略,构建有限样本下有效的预测区间。COPP利用推断预测方法,提供基于协变量自适应、分布自由的预测区间,并保证边际覆盖概率,其在合成数据与真实世界基准测试中,均在覆盖准确性和区间宽度方面优于现有方法。

ABSTRACT

Most off-policy evaluation methods for contextual bandits have focused on the expected outcome of a policy, which is estimated via methods that at best provide only asymptotic guarantees. However, in many applications, the expectation may not be the best measure of performance as it does not capture the variability of the outcome. In addition, particularly in safety-critical settings, stronger guarantees than asymptotic correctness may be required. To address these limitations, we consider a novel application of conformal prediction to contextual bandits. Given data collected under a behavioral policy, we propose \emph{conformal off-policy prediction} (COPP), which can output reliable predictive intervals for the outcome under a new target policy. We provide theoretical finite-sample guarantees without making any additional assumptions beyond the standard contextual bandit setup, and empirically demonstrate the utility of COPP compared with existing methods on synthetic and real-world data.

研究动机与目标

  • 解决传统离线策略评估方法仅关注期望结果且缺乏有限样本有效性的局限性。
  • 开发一种方法,提供可靠的预测区间以捕捉结果的变异性,尤其适用于小样本或风险敏感的场景。
  • 确保覆盖概率能够自适应协变量$X$,避免现有方法中常见的过度保守区间。
  • 将推断预测方法扩展至上下文Bandit设置中的随机策略与连续动作空间。
  • 通过实证验证,COPP在保持目标覆盖水平的同时,产生的区间比竞争方法更紧凑。

提出的方法

  • COPP通过构建预测集$\hat{C}(x)$,将推断预测方法应用于离线策略结果预测,确保该集合以预设概率包含真实结果$Y$。
  • 采用逆概率加权方法,对行为策略$\pi^b$下的观测数据进行重加权,以估计目标策略$\pi^*$下的结果分布。
  • 基于估计的条件概率$\hat{P}^{\pi^b}(y|x)$定义一个得分函数$s(x,y)$,用于对结果进行排序,以支持推断预测。
  • 通过在校准集上对得分经验分布的$1-\alpha$分位数,将得分最低的结果纳入预测集。
  • 对于离散结果,直接在结果空间$\mathcal{Y}$上计算分位数,避免基于网格的近似方法。
  • 该方法确保有限样本下的边际覆盖概率:$\mathbb{P}(Y \in \hat{C}(X)) \geq 1 - \alpha - o(n^{-1})$,在弱正则性条件下具有渐近条件覆盖概率。

实验结果

研究问题

  • RQ1能否将推断预测方法适配至上下文Bandit中,为离线策略结果提供有限样本、协变量自适应的预测区间?
  • RQ2COPP在覆盖性能方面与现有离线策略评估方法(如WIS和SBA)相比,其准确性和区间宽度表现如何?
  • RQ3COPP在不同政策偏移程度和异质数据分布下是否仍能保持可靠的覆盖性能?
  • RQ4COPP在何种条件下可实现渐近条件覆盖?其与模型误设的关系如何?
  • RQ5COPP能否扩展至处理离散结果设置下的标签条件覆盖保证?

主要发现

  • COPP在所有测试的目标策略下,覆盖水平始终接近名义上的$90\%$,而WIS和SBA方法在政策偏移增大时变得愈发保守。
  • 在$n = 5000$个校准点的实验中,COPP实现了$90.1\%$的平均覆盖水平,显著优于WIS($94.3\%$)和SBA($95.1\%$)。
  • COPP生成的预测区间比WIS和SBA更窄,尤其在离散结果设置中,WIS因缺乏$X$自适应性,常将所有标签纳入区间。
  • 该方法对政策偏移和异方差性具有鲁棒性,避免了非自适应方法中常见的过度保守问题。
  • 通过类别平衡的推断预测方法,实现了标签条件覆盖,实证结果表明每类的条件覆盖率均$\geq 90\%$,而标准COPP在该约束下可能失效。
  • 实证结果证实,随着校准数据量的增加,COPP的覆盖性能持续改善并收敛至目标水平,而竞争方法则始终保持过度保守。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。