Skip to main content
QUICK REVIEW

[论文解读] Optimizing Quantiles in Preference-based Markov Decision Processes

Hugo Gilbert, Paul Weng|arXiv (Cornell University)|Dec 1, 2016
Advanced Database Systems and Queries被引用 7
一句话总结

本文提出了一种新颖的算法,用于在基于偏好的马尔可夫决策过程(MDP)中计算在分位数准则下最优的策略,通过使用函数后向归纳法的二分查找来求解一系列具有目标效用函数的期望效用问题。主要贡献在于一种确保高性能阈值以高概率满足的方法,并在随机MDP和数据中心控制问题上进行了实验验证,结果表明其在鲁棒性方面优于基于期望的策略。

ABSTRACT

In the Markov decision process model, policies are usually evaluated by expected cumulative rewards. As this decision criterion is not always suitable, we propose in this paper an algorithm for computing a policy optimal for the quantile criterion. Both finite and infinite horizons are considered. Finally we experimentally evaluate our approach on random MDPs and on a data center control problem.

研究动机与目标

  • 为解决在风险规避或一次性决策场景中,期望累积奖励作为决策准则在MDP中的局限性。
  • 开发一种计算策略的方法,以优化累积奖励分布的指定分位数,确保在期望轨迹的一定比例下具有高可靠性。
  • 建立在有限和无限时域MDP中,基于分位数准则的最优策略的理论性质。
  • 在合成MDP和真实世界的数据中心控制问题上,对所提出的算法进行实证评估,并与基于期望的策略进行性能比较。
  • 扩展MDP在序数偏好或对尾部风险具有鲁棒性至关重要的场景中的适用性,例如在云服务或金融领域。

提出的方法

  • 将分位数优化问题重新表述为一系列使用反映分位数阈值的目标效用函数的期望效用问题。
  • 在分位数值上采用二分查找过程,每次迭代通过函数后向归纳法求解一个期望效用MDP。
  • 函数后向归纳法递归计算价值函数,适应于编码分位数目标的效用变换。
  • 通过迭代细化阈值直至收敛,该算法返回满足τ-分位数准则的ϵ-最优策略。
  • 该方法支持有限和无限时域MDP,并在策略存在性和最优性方面提供理论保证。
  • 该方法在随机MDP和数据中心控制问题上实现并进行了评估,使用累积奖励分布来比较策略性能。

实验结果

研究问题

  • RQ1是否可以计算出一种策略,以最大化MDP中累积奖励的τ-分位数,即使奖励分布呈偏态?
  • RQ2如何将分位数准则简化为MDP中的一系列标准期望效用问题?
  • RQ3在有限和无限时域设置下,基于分位数准则的最优策略表现出哪些理论特性?
  • RQ4与基于期望的策略相比,分位数优化策略在可靠性与鲁棒性方面的性能表现如何?
  • RQ5所提出的算法是否能有效扩展到真实世界问题(如数据中心控制),其中高分位数(例如99.9%)至关重要?

主要发现

  • 所提出的算法成功通过在一系列期望效用问题上进行二分查找,计算出满足τ-分位数准则的ϵ-最优策略。
  • 在数据中心控制问题中,分位数优化策略在可靠性方面显著优于基于期望的策略,确保99%的用户获得高性能。
  • 分位数优化策略下的累积奖励分布更倾向于高奖励,从而降低了不良结果的风险。
  • 理论分析证实,在有限和无限时域MDP中,存在针对分位数准则的确定性马尔可夫最优策略。
  • 函数后向归纳法能够高效计算在变换效用下的价值函数,使该算法可扩展至中等规模问题。
  • 实验结果表明,分位数优化策略比基于期望的策略更具鲁棒性,尤其在现实应用中常见的偏态奖励分布下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。