Skip to main content
QUICK REVIEW

[论文解读] Offline Policy Selection under Uncertainty

Mengjiao Yang, Bo Dai|arXiv (Cornell University)|Dec 12, 2020
Advanced Bandit Algorithms Research参考文献 50被引用 10
一句话总结

该论文提出 BayesDICE,一种贝叶斯方法,用于在离线强化学习中估计策略价值上的信念分布,通过在分布校正比率上使用后验正则化,实现在不确定性下的灵活策略排序。在多种指标(如 top-k 损失和相关性)下,其策略选择性能优于点估计基线方法,尤其当下游评估标准与排序得分对齐时表现更优。

ABSTRACT

The presence of uncertainty in policy evaluation significantly complicates the process of policy ranking and selection in real-world settings. We formally consider offline policy selection as learning preferences over a set of policy prospects given a fixed experience dataset. While one can select or rank policies based on point estimates of their policy values or high-confidence intervals, access to the full distribution over one's belief of the policy value enables more flexible selection algorithms under a wider range of downstream evaluation metrics. We propose BayesDICE for estimating this belief distribution in terms of posteriors of distribution correction ratios derived from stochastic constraints (as opposed to explicit likelihood, which is not available). Empirically, BayesDICE is highly competitive to existing state-of-the-art approaches in confidence interval estimation. More importantly, we show how the belief distribution estimated by BayesDICE may be used to rank policies with respect to any arbitrary downstream policy selection metric, and we empirically demonstrate that this selection procedure significantly outperforms existing approaches, such as ranking policies according to mean or high-confidence lower bound value estimates.

研究动机与目标

  • 将离线策略选择形式化为基于固定离线数据集的策略前景偏好学习问题。
  • 解决点估计在策略选择中的局限性,其在多样化下游评估指标(如 top-k 损失或精确度)下可能表现不佳。
  • 开发一种方法,对策略价值估计完整的后验分布,从而在任意效用函数下实现灵活且最优的排序。
  • 通过在校正比率上应用贝叶斯后验正则化,提升离策略评估中置信区间估计的准确性。
  • 通过实证验证,使用后验样本将排序得分与下游指标对齐,可显著提升策略选择性能。

提出的方法

  • BayesDICE 使用随机约束而非显式似然函数,对每个状态-动作对的分布校正比率估计后验分布。
  • 通过在深度 Q-Network 的最后一层应用贝叶斯线性回归,将 DICE 框架扩展至建模 Q 值中的不确定性。
  • 从学习到的后验分布中进行蒙特卡洛采样,以估计置信区间和策略价值上的信念分布。
  • 该方法使用后验正则化以满足马尔可夫决策过程中的机会约束,确保对分布偏移和先验错位的鲁棒性。
  • 策略排序通过算法 1 执行,该算法从后验分布中模拟以计算与任意下游指标(如 top-k 损失或精确度)对齐的得分。
  • 该方法在离散和连续控制任务中,通过置信区间覆盖率和策略选择性能进行评估。

实验结果

研究问题

  • RQ1与频率学派点估计相比,离策略价值估计的贝叶斯方法是否能提供更准确且更鲁棒的策略价值信念分布?
  • RQ2在策略选择中,若将排序得分与下游评估指标对齐,是否能显著优于使用均值或置信区间下界估计?
  • RQ3与最先进 OPE 方法相比,BayesDICE 在置信区间估计方面的表现如何?
  • RQ4BayesDICE 估计的后验分布是否能有效用于在多样化效用函数下提升策略选择性能?
  • RQ5BayesDICE 的性能增益是否在不同大小的离线数据集和行为策略下均保持稳健?

主要发现

  • 在置信区间估计中,BayesDICE 在所有置信水平下均实现了接近名义水平的实证覆盖率,且区间宽度较窄,表明后验估计具有高精度。
  • 在策略选择中,使用对齐排序得分的 BayesDICE(即 $\hat{\mathcal{S}} = \mathcal{S}$)显著优于基于均值或置信区间下界估计的排序,尤其在最小化 top-k 损失方面表现突出。
  • 在双臂老虎机任务中,采用对齐得分的方法实现了接近最优的性能,接近于通过解析计算得到的贝叶斯最优排序。
  • 在 Reacher 环境中,BayesDICE 在不同数据集大小下,均在 top-k 损失和相关性指标上优于 DualDICE 和其他点估计基线方法。
  • 下界点估计始终表现逊于均值或上界估计,凸显了在策略选择中使用保守点估计的风险。
  • 实证结果表明,使用完整的信念分布可实现比依赖单一点估计(即使为置信区间)更鲁棒、更灵活的策略选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。