[论文解读] Off-Policy Evaluation for Large Action Spaces via Embeddings
本文提出了一种新型的离策略评估估计器——边际重要性采样(Marginalized IPS, MIPS),适用于大规模动作空间,通过利用动作嵌入来降低偏差和方差。通过基于动作嵌入的边际重要性权重,MIPS 在动作数超过 1,000 时,其均方误差显著低于传统的 IPS 和 DR 估计器,从而在推荐系统等高维设置中实现了可靠的策略评估。
Off-policy evaluation (OPE) in contextual bandits has seen rapid adoption in real-world systems, since it enables offline evaluation of new policies using only historic log data. Unfortunately, when the number of actions is large, existing OPE estimators -- most of which are based on inverse propensity score weighting -- degrade severely and can suffer from extreme bias and variance. This foils the use of OPE in many applications from recommender systems to language models. To overcome this issue, we propose a new OPE estimator that leverages marginalized importance weights when action embeddings provide structure in the action space. We characterize the bias, variance, and mean squared error of the proposed estimator and analyze the conditions under which the action embedding provides statistical benefits over conventional estimators. In addition to the theoretical analysis, we find that the empirical performance improvement can be substantial, enabling reliable OPE even when existing estimators collapse due to a large number of actions.
研究动机与目标
- 解决现有离策略评估(OPE)估计器在动作空间较大时出现的严重偏差和方差退化问题。
- 利用结构化动作嵌入(如电影的类型、导演等)提升 OPE 中的统计效率。
- 开发一种理论基础坚实的估计器,在弱于标准 IPS 的条件下保持无偏性。
- 刻画嵌入质量与维度引入的偏差-方差权衡。
- 通过实证验证,MIPS 即使在传统估计器因动作空间基数过高而失效时,也能实现可靠的 OPE。
提出的方法
- 提出边际重要性采样(MIPS),通过动作嵌入的边缘分布而非单个动作来计算重要性权重。
- 定义新的重要性权重为 $ w(e) = \frac{\pi(a|x,e)}{\pi_0(a|x,e)} $,其中 $ e $ 是动作 $ a $ 的嵌入,并利用该权重估计策略价值。
- 在动作嵌入中介导动作对奖励所有因果效应的条件下,建立无偏性。
- 推导 MIPS 的偏差、方差和均方误差(MSE)的理论界,表明在高维动作空间中可实现方差降低。
- 提出一种策略:通过剪枝较不相关的嵌入维度来有意违反嵌入假设,以最小化 MSE。
- 采用基于自举法的评估,使用相对均方误差(rel-SE)比较真实世界和合成的上下文多臂老虎机数据中估计器的性能。
实验结果
研究问题
- RQ1在何种条件下,使用动作嵌入可实现在大规模动作空间中的无偏离策略评估?
- RQ2随着动作数增加,MIPS 的方差与 IPS 和 DR 估计器相比如何?
- RQ3MIPS 中偏差与方差的权衡关系如何?嵌入质量如何影响该权衡?
- RQ4MIPS 是否能在高基数动作空间中实现低于现有 OPE 估计器的均方误差?
- RQ5尽管引入一定偏差,剪枝无关的嵌入维度是否能改善 MIPS 的 MSE?
主要发现
- 当动作数超过 1,000 时,MIPS 的均方误差显著低于 IPS 和 DR 估计器,某些情况下方差降低超过 300 倍。
- 当动作数从 10 增加到 5,000 时,IPS 的方差增加超过 300 倍,而 MIPS 由于基于嵌入的边缘化,能保持低方差。
- 当嵌入准确反映动作与奖励之间的因果关系时,MIPS 的偏差低于 IPS。
- 剪枝不相关的嵌入维度所降低的方差大于其增加的偏差,从而整体改善 MSE,验证了所提出的权衡策略。
- 在真实世界多臂老虎机数据上的实证结果表明,MIPS 在不同样本量下,相对均方误差始终优于 IPS、DR 和 MRDR。
- 相对均方误差的累积分布函数(CDF)显示,即使在数据有限的情况下,当动作嵌入具有信息量时,MIPS 在 90% 的自举试验中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。