[论文解读] Doubly robust off-policy evaluation with shrinkage
本文提出了一种用于上下文Bandit中双重稳健离策略评估的新型收缩框架,通过优化重要性权重以最小化均方误差(MSE)界。通过引入悲观和乐观收缩策略,推导出新型估计器——包括一种权重裁剪变体以及首个针对组合动作的基于收缩的方法——在原子和组合Bandit设置中显著优于最先进方法,且在多种数据环境下均通过了广泛的实证验证。
We propose a new framework for designing estimators for off-policy evaluation in contextual bandits. Our approach is based on the asymptotically optimal doubly robust estimator, but we shrink the importance weights to minimize a bound on the mean squared error, which results in a better bias-variance tradeoff in finite samples. We use this optimization-based framework to obtain three estimators: (a) a weight-clipping estimator, (b) a new weight-shrinkage estimator, and (c) the first shrinkage-based estimator for combinatorial action sets. Extensive experiments in both standard and combinatorial bandit benchmark problems show that our estimators are highly adaptive and typically outperform state-of-the-art methods.
研究动机与目标
- 为解决由高重要性权重引起的双重稳健离策略评估中的有限样本方差问题。
- 开发一种系统化、理论基础坚实的策略,用于根据奖励预测器质量对重要性权重进行收缩。
- 设计新型估计器——包括权重裁剪变体和一种新颖的组合动作集收缩方法——以提升均方误差性能。
- 在多样化的真实世界和合成Bandit基准中,对所提框架进行实证验证,涵盖标准和组合动作设置。
- 证明奖励预测器选择与收缩策略之间存在相互依赖关系,对实际估计器设计具有启示意义。
提出的方法
- 通过优化均方误差(MSE)的紧致界,推导出一种一般性的重要性权重收缩框架,采用两种界定技术:一种对奖励预测器质量不敏感(悲观),另一种则纳入其质量信息(乐观)。
- 将权重裁剪估计器作为悲观收缩的特例引入,为其实证成功提供理论依据。
- 基于乐观收缩开发一种新型权重收缩估计器,可自适应奖励预测器质量,改善偏差-方差权衡。
- 将收缩框架扩展至组合动作集,实现该场景下首个基于收缩的离策略估计器。
- 基于偏差界估计(悲观、乐观及组合形式)进行模型选择,以在多样化数据条件下选取最优收缩参数。
- 采用单遍算法设计,实现对大规模数据集的可扩展性,与先前具有超线性时间复杂度的方法形成对比。
实验结果
研究问题
- RQ1如何系统性地收缩重要性权重,以在离策略评估中最小化均方误差,且无需对奖励预测器施加强假设?
- RQ2权重裁剪与收缩之间存在何种理论关系?其是否对应于特定的优化目标?
- RQ3是否能通过利用奖励预测器质量的乐观收缩策略,实现优于悲观或标准双重稳健估计器的性能?
- RQ4如何将收缩方法扩展至组合动作集,即多个动作同时被选择的场景?
- RQ5奖励预测器选择与收缩策略之间存在何种相互作用?应如何联合选择以实现最优性能?
主要发现
- 所提出的悲观收缩框架将权重裁剪解释为特例,为一种广泛使用的启发式方法提供了理论依据。
- 在真实世界数据集的108个实验条件下,乐观收缩估计器始终优于标准双重稳健和裁剪估计器,且在有利设置下归一化MSE降低最高达30%。
- 针对组合动作的新收缩估计器在标准学习排序基准上达到最先进性能,证明了该复杂场景下收缩方法的首次成功应用。
- 基于悲观、乐观及朴素偏差界最小值的模型选择方法(
- MRDR奖励预测器与DRs-upper估计器的组合在110种条件中取得最多唯一最优结果(57项),但仅当与正确收缩策略配对时成立,凸显估计器组件对齐的重要性。
- 在小样本场景下,DRs-upper估计器配合乐观收缩与最优模型选择,优于所有其他方法,在最严峻场景中实现40%更低的归一化MSE。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。