[论文解读] Adaptive Estimator Selection for Off-Policy Evaluation
本文提出Slope,一种用于离策略评估的、基于数据的自适应估计器选择方法,其性能与最优估计器相比仅相差一个常数因子。通过利用基于方差的置信带在偏差与方差之间取得平衡,Slope在强化学习领域优于现有方法(如Magic),并在各种环境(包括上下文Bandit和RL领域)中一致地选择出最优超参数。
We develop a generic data-driven method for estimator selection in off-policy policy evaluation settings. We establish a strong performance guarantee for the method, showing that it is competitive with the oracle estimator, up to a constant factor. Via in-depth case studies in contextual bandits and reinforcement learning, we demonstrate the generality and applicability of the method. We also perform comprehensive experiments, demonstrating the empirical efficacy of our approach and comparing with related approaches. In both case studies, our method compares favorably with existing methods.
研究动机与目标
- 解决强化学习和上下文Bandit中选择最优离策略估计器这一关键挑战,传统方法(如交叉验证)因缺乏无偏误差估计而失效。
- 克服估计器超参数调优中的偏差-方差权衡问题,该问题通常依赖启发式或领域特定的指导方针,泛化能力有限。
- 开发一种通用的、具有理论基础的方法,适用于多种离策略评估场景,包括连续动作的上下文Bandit和部分重要性加权的强化学习。
- 建立性能保证,证明所选估计器在最小假设下与最优选择相比仅相差一个常数因子。
- 在多种环境和估计器族中展示该方法的实证优越性,优于现有方法(如Magic和固定时域估计器)。
提出的方法
- 利用每个估计器的方差估计,构建其(有偏)期望的置信带,避免对无偏误差估计的需求。
- 应用Lepski型选择规则,识别出置信带最窄且仍能将所有其他估计器的期望包含在容差范围内的估计器。
- 通过选择使偏差与方差之和最小的估计器来平衡偏差与方差,该和通过置信带宽度和与其他估计器的重叠程度近似。
- 将选择过程形式化为一种基于数据的替代方法,替代最优调优,仅使用可观测的方差估计,无需真实误差估计。
- 将该方法扩展至两个关键应用场景:连续动作上下文Bandit中的带宽选择,以及强化学习中部分重要性加权估计器的时域选择。
- 使用非参数统计技术(如Lepski方法)实现该方法,以确保在不同数据条件下具有理论一致性和鲁棒性。
实验结果
研究问题
- RQ1能否开发一种基于数据的估计器选择方法,避免在离策略评估中出现交叉验证和最小化边界方法的缺陷?
- RQ2通用选择过程在多类离策略评估场景中,其性能与最优估计器相比能达到何种程度的竞争力?
- RQ3与现有方法(如Magic)相比,该方法在高方差或模型不匹配设置下的实际表现如何?
- RQ4该方法是否能泛化至不同类型估计器(如基于模型的方法和重要性采样方法),在上下文Bandit和强化学习中均适用?
- RQ5该方法能否在无需真实误差估计或领域特定调优的情况下,可靠地选择最优超参数(如带宽、虚假时域)?
主要发现
- Slope在所有实验条件下均一致选择出与天际线最优估计器(实践中不可行)性能相当的估计器,优于任何固定超参数的选择。
- 在强化学习设置中,Slope在Gridworld、Mountain Car和Hybrid等多个领域中显著优于Magic,后者是唯一其他可比较的估计器选择方法。
- 在具有连续动作的上下文Bandit中,Slope在所有测试带宽下均实现了低均方误差(MSE),展现出稳健性和适应性。
- 在Hybrid领域,Slope的学习曲线在样本量增加时表现出稳定且低的误差,误差带始终低于基线方法。
- 成对t检验表明,在全部106个实验条件下,Slope的性能在0.05显著性水平上均显著优于所有基线方法。
- 该方法在具有不同策略不匹配、稀疏奖励和随机性的环境中均表现出强劲的实证性能,验证了其泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。