Skip to main content
QUICK REVIEW

[论文解读] Hindsight Learning for MDPs with Exogenous Inputs

Sean R. Sinclair, Felipe Vieira Frujeri|arXiv (Cornell University)|Jul 13, 2022
Age of Information Optimization被引用 4
一句话总结

本文提出了一种名为事后学习(Hindsight Learning, HL)的数据高效强化学习框架,适用于具有外生输入的马尔可夫决策过程(Exo-MDPs),其中不确定性仅源于外部不可控变量。通过利用历史外生输入对过去决策进行事后重评,HL 显著降低了数据需求,相较于启发式方法和最先进的强化学习算法,在多秘书员问题、航空公司收益管理以及真实世界云虚拟机(VM)分配任务中表现更优。

ABSTRACT

Many resource management problems require sequential decision-making under uncertainty, where the only uncertainty affecting the decision outcomes are exogenous variables outside the control of the decision-maker. We model these problems as Exo-MDPs (Markov Decision Processes with Exogenous Inputs) and design a class of data-efficient algorithms for them termed Hindsight Learning (HL). Our HL algorithms achieve data efficiency by leveraging a key insight: having samples of the exogenous variables, past decisions can be revisited in hindsight to infer counterfactual consequences that can accelerate policy improvements. We compare HL against classic baselines in the multi-secretary and airline revenue management problems. We also scale our algorithms to a business-critical cloud resource management problem -- allocating Virtual Machines (VMs) to physical machines, and simulate their performance with real datasets from a large public cloud provider. We find that HL algorithms outperform domain-specific heuristics, as well as state-of-the-art reinforcement learning methods.

研究动机与目标

  • 解决在存在不可控外部不确定性资源管理问题中强化学习的数据效率低下问题。
  • 将此类问题建模为Exo-MDPs,其中仅外生输入(如虚拟机请求、需求波动)引入不确定性。
  • 开发一种新颖的学习框架,通过重用历史外生输入生成过去决策的反事实结果,从而实现更高效策略改进。
  • 在合成与真实世界场景中,证明事后学习相较于领域特定启发式方法和最先进的强化学习方法具有更优性能。
  • 使用真实生产数据将该方法扩展至大规模、关键业务级云虚拟机分配问题,验证其实际适用性与鲁棒性。

提出的方法

  • 将资源管理问题形式化为Exo-MDPs,其中系统动态依赖于内生状态和与智能体行为无关的外生输入。
  • 引入事后规划器(Hindsight Planner),利用观测到的外生输入序列计算过去决策的反事实奖励,从而在无需新的环境交互的情况下实现策略改进。
  • 设计一种事后学习算法,通过学习这些反事实结果来模仿贝叶斯最优选择器,降低方差并加速收敛。
  • 应用值分解技术分解Exo-MDPs中的值函数,实现在高维状态与输入空间中的可扩展学习。
  • 使用图神经网络(GNNs)表示虚拟机和物理机的特征,使策略能够泛化到复杂的分配配置。
  • 实现一种可扩展的事后启发式方法用于真实世界VM分配,按大小和生命周期优先分配虚拟机,平均双间隙(dual gap)低于4%,达到近似最优性能。

实验结果

研究问题

  • RQ1能否通过利用观测到的外生输入对过去决策进行事后重评,提升在外部不确定性下的序列决策问题中的数据效率?
  • RQ2在多秘书员问题与航空公司收益管理问题中,事后学习相较于经典启发式方法和最先进的强化学习方法表现如何?
  • RQ3事后学习在具有高维连续时间输入的真实世界大规模云资源分配中,其可扩展性如何?
  • RQ4在真实世界VM分配中,所提出的事后启发式方法与最优解的接近程度如何?其经验性能差距是多少?
  • RQ5在使用真实世界数据的生产规模云环境中,事后学习能否在性能上超越端到端强化学习和启发式基线方法?

主要发现

  • 在真实世界VM分配任务中,事后学习在负逆打包密度度量上达到 0.18 ± 0.093 的性能,显著优于 DQN(-1.00 ± 0.41)和 MAC(-0.38 ± 0.033)。
  • 事后学习 MAC 算法将打包密度降低了 0.05%,相比次优基线 DQN(仅降低 0.05%)实现了 1.5 倍的性能提升。
  • 在模拟的 VM 分配环境中,事后学习 MAC 实现了 0.05% 的打包密度改善,而最佳基线(MAC)仅实现 -0.03%,表明其在数据效率方面具有明显优势。
  • 事后启发式方法在 24 个真实世界集群中平均双间隙仅为 4.33%,个体差距范围在 1.17% 至 20.07% 之间,表明在大多数情况下接近最优。
  • 在合成与真实世界设置中,事后学习在所有指标上均优于所有基线方法(包括 DQN、策略梯度和 AC),展现出一致的优越性。
  • 与次优基线相比,该方法在打包密度降低方面实现了 1.5 倍的提升,表明其在减少云数据中心资源碎片化与能耗方面具有显著的实际影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。