Skip to main content
QUICK REVIEW

[论文解读] Batch Policy Learning in Average Reward Markov Decision Processes

Peng Liao, Zhengling Qi|arXiv (Cornell University)|Jul 23, 2020
Advanced Bandit Algorithms Research参考文献 27被引用 15
一句话总结

本文提出了一种用于无限时域马尔可夫决策过程中的批量策略学习的平均奖励双重稳健估计器,实现了半参数效率,并在参数化策略类中实现了最优策略搜索。该方法确保了有限样本 regret 保证,并在模拟和真实世界 mHealth 应用中优于现有的离线强化学习基线方法。

ABSTRACT

We consider the batch (off-line) policy learning problem in the infinite horizon Markov Decision Process. Motivated by mobile health applications, we focus on learning a policy that maximizes the long-term average reward. We propose a doubly robust estimator for the average reward and show that it achieves semiparametric efficiency. Further we develop an optimization algorithm to compute the optimal policy in a parameterized stochastic policy class. The performance of the estimated policy is measured by the difference between the optimal average reward in the policy class and the average reward of the estimated policy and we establish a finite-sample regret guarantee. The performance of the method is illustrated by simulation studies and an analysis of a mobile health study promoting physical activity.

研究动机与目标

  • 解决使用批量(离线)数据在无限时域马尔可夫决策过程中学习最优策略的挑战,特别是在长期结果至关重要的移动健康(mHealth)情境中。
  • 通过聚焦于平均奖励作为长期行为维持的更自然性能度量,克服折扣奖励公式在折扣因子趋近于 1 时可能产生的不稳定性与非鲁棒性。
  • 为平均奖励开发一种数据高效、性能稳定可靠的估计器,以实现对预设参数化策略类的可靠优化。
  • 为估计策略建立有限样本 regret 边界,确保相对于策略类中最优策略的性能理论保证。
  • 通过模拟和一项真实世界的移动健康研究,验证该方法在实际应用中的有效性,以促进体力活动。

提出的方法

  • 提出一种新颖的双重稳健估计器,用于无限时域 MDP 中策略的平均奖励,结合结果回归与倾向得分估计,在较弱正则性条件下实现半参数效率。
  • 推导估计平均奖励相对于策略参数的闭式梯度,从而可通过标准梯度方法实现高效优化。
  • 将策略优化问题表述为对估计平均奖励的约束最大化问题,使用拉格朗日松弛法处理平稳分布的归一化约束。
  • 将双重稳健估计器整合到策略搜索算法中,以在参数类中计算最优策略,同时确保统计效率与计算可及性。
  • 采用两阶段估计程序:首先估计干扰函数(条件均值奖励与转移概率),然后将它们代入双重稳健估计器以获得平均奖励。
  • 应用有限样本 regret 分析,以界定策略类中最优平均奖励与估计策略奖励之间的差异,提供理论性能保证。

实验结果

研究问题

  • RQ1在无限时域 MDP 中,平均奖励的双重稳健估计器是否能在正则性条件下实现半参数效率,并确保策略学习中的低 regret?
  • RQ2在有限批量数据条件下,与现有离线强化学习算法(如 BEAR、BCQ、FQI)相比,该方法在 regret 和平均奖励估计方面表现如何?
  • RQ3在长期结果优先于折扣奖励的移动健康应用中,该方法在多大程度上提升了策略性能?
  • RQ4轨迹长度和轨迹数量对估计策略的有限样本性能有何影响?
  • RQ5通过限制在参数化策略类中,该方法是否能保持低方差与高可解释性,同时仍实现优异性能?

主要发现

  • 在干扰函数估计误差的正则性条件下,所提出的平均奖励双重稳健估计器实现了半参数效率。
  • 在模拟研究中,该方法在 50 条轨迹(每条长度 48)下的 regret 为 0.009(±0.003),显著低于 BEAR(0.843 ± 0.060)、BCQ(0.652 ± 0.025)和 FQI(0.054 ± 0.027)。
  • 在最佳设置下(n=50,T=48),估计策略的平均奖励为 0.914(±0.003),优于 BEAR(0.121 ± 0.046)、BCQ(0.276 ± 0.001)和 FQI(0.853 ± 0.023)。
  • 该方法在不同数据条件下表现出一致性能,随着轨迹长度和轨迹数量的增加,regret 显著下降。
  • 在 HeartSteps mHealth 研究中,该方法成功识别出能最大化长期体力活动的策略,验证了其在真实世界移动健康应用中的实用性。
  • 有限样本 regret 边界确保了即使在数据有限的情况下,估计策略的性能也能保证接近策略类中的最优策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。