[论文解读] Sample-efficient Nonstationary Policy Evaluation for Contextual Bandits
本文提出了一种针对上下文Bandit的样本高效离线策略评估方法,统一了重要性加权、双重稳健估计与非平稳策略评估。通过精心管理偏差-方差权衡并利用目标策略的随机性,该方法降低了方差并提升了样本效率,在合成数据集与真实世界数据集上表现出色,数据利用率最高提升了整整一个数量级。
We present and prove properties of a new offline policy evaluator for an exploration learning setting which is superior to previous evaluators. In particular, it simultaneously and correctly incorporates techniques from importance weighting, doubly robust evaluation, and nonstationary policy evaluation approaches. In addition, our approach allows generating longer histories by careful control of a bias-variance tradeoff, and further decreases variance by incorporating information about randomness of the target policy. Empirical evidence from synthetic and realworld exploration learning problems shows the new evaluator successfully unifies previous approaches and uses information an order of magnitude more efficiently.
研究动机与目标
- 解决在离线数据有限的上下文Bandit设置中评估策略的挑战。
- 通过结合多种成熟技术,提升离线策略评估的样本效率。
- 通过显式建模目标策略的随机性,进一步降低策略评估中的方差。
- 通过可控的偏差-方差权衡,实现从有限数据中生成更长的有效数据历史。
- 统一并超越先前方法,在合成与真实世界探索学习问题中均表现更优。
提出的方法
- 将重要性加权与双重稳健估计相结合,以提升离线策略评估的准确性并降低方差。
- 引入非平稳策略评估技术,以处理随时间变化的行为策略。
- 提出一种偏差-方差权衡机制,使在数据有限的情况下能够生成更长的有效数据历史。
- 利用对目标策略随机性的先验知识,进一步降低评估估计器的方差。
- 采用统一的估计器,将重要性加权、双重稳健性与非平稳性三者整合进一个统一连贯的框架中。
- 采用改进的经验风险最小化方法,同时考虑行为策略与目标策略的分布。
实验结果
研究问题
- RQ1是否能够通过统一的离线策略评估方法,在上下文Bandit设置中同时提升样本效率并降低方差?
- RQ2将目标策略的随机性纳入考虑后,对策略评估估计器的方差有何影响?
- RQ3在数据有限的情况下,偏差-方差权衡的控制程度在多大程度上可实现更长的有效数据历史的生成?
- RQ4结合重要性加权、双重稳健估计与非平稳评估是否能持续优于单一方法?
- RQ5在合成与真实世界上下文Bandit问题中,所提出方法与先前方法相比表现如何?
主要发现
- 通过引入目标策略随机性,所提方法相比基线方法显著降低了方差。
- 在合成与真实世界实验中,该方法使数据的有效利用率比以往方法高出一个数量级。
- 统一的估计器在准确性和稳定性方面均优于单独使用重要性加权或双重稳健估计的方法。
- 通过可控的偏差-方差权衡,可生成更长的有效历史,从而提升评估的可靠性。
- 在真实世界探索学习问题上的实证结果证实了该方法在样本效率与鲁棒性方面的优越性。
- 该方法在多种评估指标上均表现出一致的改进,包括均方误差与置信区间覆盖率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。