[论文解读] Confident Off-Policy Evaluation and Selection through Self-Normalized Importance Weighting
本文提出了一种新颖的高概率下界方法,用于上下文Bandit中的离策略评估,采用自归一化重要性加权(SN),结合半经验的Efron-Stein尾部不等式与乘法偏差控制。该方法在合成数据集和真实世界数据集上相较于最先进基线方法,实现了更紧的置信区间和更优的策略选择性能。
We consider off-policy evaluation in the contextual bandit setting for the purpose of obtaining a robust off-policy selection strategy, where the selection strategy is evaluated based on the value of the chosen policy in a set of proposal (target) policies. We propose a new method to compute a lower bound on the value of an arbitrary target policy given some logged data in contextual bandits for a desired coverage. The lower bound is built around the so-called Self-normalized Importance Weighting (SN) estimator. It combines the use of a semi-empirical Efron-Stein tail inequality to control the concentration and a new multiplicative (rather than additive) control of the bias. The new approach is evaluated on a number of synthetic and real datasets and is found to be superior to its main competitors, both in terms of tightness of the confidence intervals and the quality of the policies chosen.
研究动机与目标
- 解决在有限日志数据下,上下文Bandit中可靠离策略评估与选择的挑战。
- 为目标策略的价值构建一个高概率下界,即使在重要性权重具有重尾分布时仍保持紧致。
- 通过控制离策略估计中偏差与方差的置信区间,提升策略选择的鲁棒性。
- 克服标准重要性加权与逆倾向得分方法在行为策略与目标策略不匹配场景下的局限性。
- 实现离策略选择在个性化医疗、在线广告等实际应用中的可行部署。
提出的方法
- 以自归一化重要性加权(SN)作为核心估计器,以稳定方差并确保所有矩均有界。
- 引入半经验的Efron-Stein不等式,以控制SN估计器的尾部集中性。
- 采用乘法偏差校正而非加法偏差控制,提升有限样本下的性能。
- 基于SN估计,推导出目标策略价值的有限样本高概率下界。
- 利用经验似然与矩生成函数技术,校准置信区间。
- 采用Gibbs拟合方法调整超参数,提升在多样化数据集上的鲁棒性。
实验结果
研究问题
- RQ1能否为离策略评估构建一个高概率下界,使其在重要性权重具有重尾分布时仍保持紧致?
- RQ2在有限样本性能方面,SN估计中的乘法偏差控制与加法偏差校正相比表现如何?
- RQ3所提出的方法能否在策略选择准确性和置信区间紧致性方面优于现有离策略评估基线?
- RQ4半经验的Efron-Stein不等式在实际中控制SN估计器集中性方面效果如何?
- RQ5该方法在具有不同策略不匹配程度的真实世界与合成数据集上是否保持鲁棒性?
主要发现
- 在所有数据集中,所提方法的置信区间比所有评估基线都更紧,SN的ESLB(Efron-Stein下界)始终优于其他方法。
- 在Letter数据集上,Gibbs拟合-SN的ESLB实现了0.997 ± 0.004的覆盖率,显著优于理想边界(0.903 ± 0.013)的实证覆盖率质量。
- 在kropt数据集上,Cheb-SN估计器结合Gibbs拟合-SN实现了0.840 ± 0.053的值,展现出在高维设置下的强劲性能。
- 该方法在策略选择方面优于所有竞争方法,所有目标策略的价值估计中均实现了最低的均方误差。
- 采用乘法偏差控制相比加法校正,能带来更稳定、更精确的边界,尤其在高方差场景下优势明显。
- 实证结果表明,基于SN的估计器结合ESLB可实现近乎理想的覆盖率(例如,在OptDigits上为0.999 ± 0.002),即使在行为策略与目标策略不匹配时亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。