Skip to main content
QUICK REVIEW

[论文解读] Off-Policy Risk Assessment in Contextual Bandits

Audrey Huang, Liu Leqi|arXiv (Cornell University)|Apr 18, 2021
Advanced Bandit Algorithms Research参考文献 60被引用 11
一句话总结

本文提出了离策略风险评估(OPRA),一种利用记录数据估计上下文Bandit中广泛类别的风险敏感目标(如CVaR、方差和均值-方差)的框架。通过估计奖励的累积分布函数(CDF)并应用Lipschitz风险泛函的插值估计器,OPRA为所有此类风险提供了统一的有限样本保证,误差界以$O(1/\sqrt{n})$的速率收敛,使用重要性采样或双重稳健估计器。

ABSTRACT

Even when unable to run experiments, practitioners can evaluate prospective policies, using previously logged data. However, while the bandits literature has adopted a diverse set of objectives, most research on off-policy evaluation to date focuses on the expected reward. In this paper, we introduce Lipschitz risk functionals, a broad class of objectives that subsumes conditional value-at-risk (CVaR), variance, mean-variance, many distorted risks, and CPT risks, among others. We propose Off-Policy Risk Assessment (OPRA), a framework that first estimates a target policy's CDF and then generates plugin estimates for any collection of Lipschitz risks, providing finite sample guarantees that hold simultaneously over the entire class. We instantiate OPRA with both importance sampling and doubly robust estimators. Our primary theoretical contributions are (i) the first uniform concentration inequalities for both CDF estimators in contextual bandits and (ii) error bounds on our Lipschitz risk estimates, which all converge at a rate of $O(1/\sqrt{n})$.

研究动机与目标

  • 为解决在上下文Bandit中超出期望奖励的离策略评估的空白,特别是针对风险敏感目标。
  • 开发一个统一框架,支持对广泛类别的风险泛函进行估计,包括CVaR、方差和均值-方差。
  • 提供在相同数据分布下对所有Lipschitz风险泛函均成立的有限样本理论保证。
  • 在随机实验不可行的实际应用中,实现实际的风险评估。

提出的方法

  • 将Lipschitz风险泛函引入为一类通用的风险目标,涵盖CVaR、方差、均值-方差以及累积前景理论(CPT)风险。
  • 提出OPRA框架,首先从记录的上下文Bandit数据中估计目标策略的奖励CDF。
  • 利用估计的CDF生成任意Lipschitz风险泛函的插值估计,确保该类中误差控制的统一性。
  • 通过重要性采样和双重稳健估计器两种方式实例化OPRA,以提升估计的稳定性。
  • 推导出上下文Bandit中CDF估计器的统一集中不等式,这是新颖的理论贡献。
  • 在温和正则性条件下,建立所有Lipschitz风险估计的$O(1/\sqrt{n})$误差收敛速率。

实验结果

研究问题

  • RQ1我们能否开发一个统一的离策略评估框架,支持在上下文Bandit中对超出期望奖励的风险敏感目标进行评估?
  • RQ2在离策略设置下,上下文Bandit中CDF估计的理论保证是什么?
  • RQ3如何确保在包括CVaR和方差在内的广泛类别的风险泛函中,实现统一的有限样本误差界?
  • RQ4在此背景下,重要性采样和双重稳健估计的风险估计收敛速率如何?
  • RQ5该框架能否应用于复杂风险度量,如累积前景理论中的风险度量?

主要发现

  • 本文首次建立了上下文Bandit中CDF估计器的统一集中不等式,使可靠的风险估计成为可能。
  • OPRA中所有Lipschitz风险估计均达到$O(1/\sqrt{n})$的收敛速率,与均值估计的最优速率一致。
  • 该框架支持广泛的风险泛函,包括条件风险价值(CVaR)、方差、均值-方差以及CPT风险。
  • OPRA提供了对整个Lipschitz风险泛函类统一成立的有限样本误差界。
  • 无论使用重要性采样还是双重稳健估计器,理论保证均得以维持,增强了对模型误设的鲁棒性。
  • 该方法使在随机实验不可行的实际场景中实现风险感知策略评估成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。