Skip to main content
QUICK REVIEW

[论文解读] Empirical Likelihood for Contextual Bandits

Nikos Karampatziakis, John Langford|arXiv (Cornell University)|Jun 7, 2019
Advanced Bandit Algorithms Research参考文献 34被引用 5
一句话总结

本文提出了一种基于经验似然(EL)的估计器和置信区间,用于上下文Bandit中的离策略评估,可在无需超参数的情况下实现更紧致、更可靠的置信区间。该方法将估计与置信区间建模为凸优化问题,从而提升有限样本下的性能,并设计出一种鲁棒的策略优化算法,通过最大化奖励置信区间的下界,优于强基线方法。

ABSTRACT

We propose an estimator and confidence interval for computing the value of a policy from off-policy data in the contextual bandit setting. To this end we apply empirical likelihood techniques to formulate our estimator and confidence interval as simple convex optimization problems. Using the lower bound of our confidence interval, we then propose an off-policy policy optimization algorithm that searches for policies with large reward lower bound. We empirically find that both our estimator and confidence interval improve over previous proposals in finite sample regimes. Finally, the policy optimization algorithm we propose outperforms a strong baseline system for learning from off-policy data.

研究动机与目标

  • 开发一种在有限样本下保持名义覆盖率的可靠、非参数化置信区间,用于上下文Bandit中的离策略评估。
  • 使用经验似然构建计算高效的估计器,实现对离策略价值估计的可证明低偏差。
  • 设计一种利用置信区间下界进行鲁棒学习的策略优化算法,以从离策略数据中学习。
  • 通过提供更紧致、经验有效的置信区间,超越现有方法如IPS、SNIPS和高斯近似。
  • 证明优化置信区间的下界可带来优于仅优化点估计的泛化性能。

提出的方法

  • 将经验似然(EL)应用于将离策略数据建模为具有无限类别的多项分布,从而在无参数假设下实现非参数似然估计。
  • 通过在单个标量上进行二分查找,推导出计算上可行的估计器,确保低偏差与渐近一致性。
  • 通过求解一个考虑大量可能数据生成世界的凸优化问题来构建置信区间,确保鲁棒的覆盖率。
  • 提出一种新颖算法,可直接计算置信区间,相比标准EL实现,时间复杂度降低log(1/ε)倍。
  • 提出一种分布鲁棒的学习目标,通过最大化置信区间的下界,与鲁棒优化原理相联系。
  • 使用Vowpal Wabbit作为黑箱Oracle进行策略学习,交替执行对偶变量更新与基于对偶变量导出的重要权重的策略优化。

实验结果

研究问题

  • RQ1经验似然能否在上下文Bandit的离策略评估中生成一个在有限样本下既窄又经验有效的置信区间?
  • RQ2所提出的EL估计器在偏差与均方误差方面相较于IPS、SNIPS等估计器表现如何?
  • RQ3优化置信区间的下界是否能带来优于仅优化点估计的策略学习效果?
  • RQ4当样本量与最大重要性权重相当时,EL置信区间是否仍能保持名义覆盖率?
  • RQ5策略学习性能的提升在多大程度上源于分布鲁棒性,而非估计器本身的质量?

主要发现

  • 所提出的EL置信区间在95%名义水平下实现了97.5%的平均经验覆盖率,优于二项分布置信区间(99.6%)和渐近高斯置信区间(91.2%),后两者分别存在过度覆盖与覆盖不足的问题。
  • EL置信区间的宽度显著小于二项分布置信区间,中位数宽度比为2.89,且在样本量与最大重要性权重相当的情况下仍保持紧致。
  • 基于置信区间下界的策略优化算法在40个数据集中的16个上优于强基线,配对t检验显示18胜6负,表明具有统计显著性提升。
  • 仅使用EL估计器可带来中等程度的性能提升,但基于下界的策略学习目标则带来显著更好的结果,表明分布鲁棒性是关键因素。
  • 该方法无需超参数且计算高效,通过低维凸优化求解置信区间,避免了迭代调优或复杂裁剪过程的需要。
  • 在合成数据中,EL区间在所有样本量下均从上方保持名义覆盖率,而渐近高斯区间则随着方差增加而出现覆盖不足且区间变宽。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。