Skip to main content
QUICK REVIEW

[论文解读] Open Bandit Dataset and Pipeline: Towards Realistic and Reproducible Off-Policy Evaluation

Yuta Saito, Shunsuke Aihara|arXiv (Cornell University)|Aug 17, 2020
Advanced Bandit Algorithms Research被引用 16
一句话总结

本文介绍了 Open Bandit Dataset 和 Open Bandit Pipeline,这是一个公开的基准数据集和标准化的软件框架,用于在上下文 bandit 设置中实现真实、可复现的离策略评估(OPE)。该数据集包含来自 ZOZOTOWN 时尚电商平台上真实 A/B 测试的两个日志 bandit 数据集,支持对 OPE 估计器进行直接比较。其主要贡献是一个可复现的实验流程,揭示了真实世界 OPE 中的关键挑战,如分布偏移和估计器偏差。

ABSTRACT

Off-policy evaluation (OPE) aims to estimate the performance of hypothetical policies using data generated by a different policy. Because of its huge potential impact in practice, there has been growing research interest in this field. There is, however, no real-world public dataset that enables the evaluation of OPE, making its experimental studies unrealistic and irreproducible. With the goal of enabling realistic and reproducible OPE research, we present Open Bandit Dataset, a public logged bandit dataset collected on a large-scale fashion e-commerce platform, ZOZOTOWN. Our dataset is unique in that it contains a set of multiple logged bandit datasets collected by running different policies on the same platform. This enables experimental comparisons of different OPE estimators for the first time. We also develop Python software called Open Bandit Pipeline to streamline and standardize the implementation of batch bandit algorithms and OPE. Our open data and software will contribute to fair and transparent OPE research and help the community identify fruitful research directions. We provide extensive benchmark experiments of existing OPE estimators using our dataset and software. The results open up essential challenges and new avenues for future OPE research.

研究动机与目标

  • 为解决离策略评估(OPE)缺乏公开的真实世界数据集的问题,该问题阻碍了 bandit 研究中的可复现性和真实场景基准测试。
  • 通过提供标准化的实验流程,实现 OPE 估计器之间的公平透明比较。
  • 通过在真实日志 bandit 数据上进行全面基准测试,识别将 OPE 应用于真实系统时的实际挑战。
  • 通过提供来自真实生产环境电商平台的生产规模数据,弥合合成模拟与真实部署之间的差距。
  • 通过开源软件和标准化评估流程,推动 OPE 研究的方法严谨性和透明度。

提出的方法

  • Open Bandit Dataset 是从 ZOZOTOWN 时尚电商平台在 A/B 测试期间运行的两种不同日志 bandit 策略——伯努利 Thompson 采样和均匀随机策略——中构建的。
  • 该数据集包含每次交互的上下文、动作、奖励和倾向得分信息,支持反事实策略评估。
  • Open Bandit Pipeline 是一个 Python 软件框架,用于标准化整个 OPE 流程,包括数据预处理、策略学习和 OPE 估计器评估。
  • 该框架支持多种 OPE 估计器(例如 IPW、DR),并可与 scikit-learn 和 PyTorch 集成用于策略学习。
  • 该流程通过使用一个策略的数据来估计另一个策略的策略值,实现端到端评估,其中真实性能通过在线策略评估计算得出。
  • 基准实验通过将 OPE 估计器的预测结果与基于在线策略数据推导出的真实策略值进行比较,以均方误差作为主要评估指标。

实验结果

研究问题

  • RQ1在真实世界 bandit 环境中,现有 OPE 估计器的表现相较于合成环境如何?
  • RQ2在将 OPE 应用于真实世界日志 bandit 数据时,关键挑战是什么,例如分布偏移和倾向得分估计?
  • RQ3标准化的软件流程能否提升 OPE 研究中的可复现性和公平性?
  • RQ4估计器性能在不同真实世界数据分布和策略行为下如何变化?
  • RQ5当将当前 OPE 方法应用于生产规模的电商数据时,其局限性是什么?

主要发现

  • Open Bandit Dataset 使得能够使用来自真实生产电商平台的真实世界数据,对 OPE 估计器进行直接、公平的比较。
  • IPW 估计器在合成数据上的均方误差为 0.00267,在多分类数据上的均方误差为 0.01827,揭示了在真实场景中性能的显著下降。
  • 与合成模拟相比,真实世界数据中的估计器偏差和方差显著更高,表明现实性存在差距。
  • 基准结果表明,许多 OPE 估计器在不同策略行为下泛化能力较差,尤其是在发生分布偏移时。
  • 本研究识别出数据质量、倾向得分估计和策略行为不匹配是真实世界 OPE 应用中的关键瓶颈。
  • Open Bandit Pipeline 实现了稳定、可复现的 OPE 实验,减少了实现差异,提升了研究的透明度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。