Skip to main content
QUICK REVIEW

[论文解读] Learning-based Two-tiered Online Optimization of Region-wide Datacenter Resource Allocation

Changlin Chen, Hanhan Zhou|arXiv (Cornell University)|Jun 29, 2023
Cloud Computing and Resource Management被引用 5
一句话总结

本文提出了一种两级深度强化学习(DRL)框架,用于在线、可扩展地优化大规模数据中心的资源分配,解决了在容量保障、容错性和网络亲和性约束下的动态工作负载放置问题。通过将高层的资源预留决策(由DRL完成)与底层的服务器映射(由MILP求解)解耦,该方法相比MIP求解器将计算时间减少了90%,成本效率提高了15%,从而实现了在大规模云环境中的实际部署。

ABSTRACT

Online optimization of resource management for large-scale data centers and infrastructures to meet dynamic capacity reservation demands and various practical constraints (e.g., feasibility and robustness) is a very challenging problem. Mixed Integer Programming (MIP) approaches suffer from recognized limitations in such a dynamic environment, while learning-based approaches may face with prohibitively large state/action spaces. To this end, this paper presents a novel two-tiered online optimization to enable a learning-based Resource Allowance System (RAS). To solve optimal server-to-reservation assignment in RAS in an online fashion, the proposed solution leverages a reinforcement learning (RL) agent to make high-level decisions, e.g., how much resource to select from the Main Switch Boards (MSBs), and then a low-level Mixed Integer Linear Programming (MILP) solver to generate the local server-to-reservation mapping, conditioned on the RL decisions. We take into account fault tolerance, server movement minimization, and network affinity requirements and apply the proposed solution to large-scale RAS problems. To provide interpretability, we further train a decision tree model to explain the learned policies and to prune unreasonable corner cases at the low-level MILP solver, resulting in further performance improvement. Extensive evaluations show that our two-tiered solution outperforms baselines such as pure MIP solver by over $15\%$ while delivering $100 imes$ speedup in computation.

研究动机与目标

  • 解决大规模数据中心(拥有数百万台服务器)中在线工作负载分配的可扩展性与动态性问题。
  • 在大规模故障发生时确保容量保障,同时最小化服务器迁移与资源冗余。
  • 克服混合整数规划(MILP)在实时、动态环境中因计算成本高和决策空间庞大而带来的局限性。
  • 设计一种可扩展的两级优化框架,实现在系统动态环境下的长期性能优化。
  • 将深度强化学习与MILP相结合,实现在真实云系统中的高效、实用化部署。

提出的方法

  • 设计两级架构:高层DRL智能体对每个预留请求做出序列化资源供给决策,而底层MILP求解器负责将预留映射到具体服务器。
  • DRL智能体通过动作转换器(softmax与指数函数)将决策映射为具体的MSB级别服务器预留,从而在减小的动作空间中运行。
  • 底层MILP最小化机架级别的资源冗余与服务器迁移成本,并将DRL智能体的输出作为约束条件。
  • 通过按服务器类型对问题进行解耦,简化优化过程并提升可扩展性。
  • 实现两种变体:单个DRL智能体与并行DRL智能体,均用于性能与可扩展性评估。
  • 使用模拟环境对框架进行训练与测试,以模拟真实数据中心的动态行为与故障场景。

实验结果

研究问题

  • RQ1基于DRL的方法是否能在大规模约束下,实现在线、动态数据中心资源分配的长期最优性能?
  • RQ2两级设计在拥有数百万个决策变量的系统中,如何显著降低DRL的计算负担?
  • RQ3在成本、延迟与可扩展性方面,所提方法相较于MIP求解器与启发式方法的优越程度如何?
  • RQ4动作转换器在真实部署中如何提升DRL决策的可行性与效率?
  • RQ5在不同运行条件下,服务器迁移成本、资源冗余与容量保障之间存在何种权衡?

主要发现

  • 所提出的两级DRL方法在30轮决策下测试时间仅为26秒,相比MIP求解器接近一小时的耗时,计算时间减少了90%。
  • 该方法相比MIP求解器整体成本降低15%,在最小化资源冗余与迁移方面展现出更优的优化性能。
  • 并行智能体变体在10,000台服务器系统上的训练时间为56分钟,表明其在大规模部署中具备可管理的可扩展性。
  • 系统在各百分位数下均保持最低的容量冗余,且从未违反冗余约束,确保了强大的可靠性。
  • 随着服务器迁移成本上升,总迁移次数减少,尽管资源分布与冗余略有增加,验证了优化中合理的权衡关系。
  • 单智能体与并行智能体变体性能相当,验证了DRL设计在不同训练配置下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。