[论文解读] Learning-based Two-tiered Online Optimization of Region-wide Datacenter Resource Allocation
本文提出了一种两级深度强化学习(DRL)框架,用于在线、可扩展地优化大规模数据中心的资源分配,解决了在容量保障、容错性和网络亲和性约束下的动态工作负载放置问题。通过将高层的资源预留决策(由DRL完成)与底层的服务器映射(由MILP求解)解耦,该方法相比MIP求解器将计算时间减少了90%,成本效率提高了15%,从而实现了在大规模云环境中的实际部署。
Online optimization of resource management for large-scale data centers and infrastructures to meet dynamic capacity reservation demands and various practical constraints (e.g., feasibility and robustness) is a very challenging problem. Mixed Integer Programming (MIP) approaches suffer from recognized limitations in such a dynamic environment, while learning-based approaches may face with prohibitively large state/action spaces. To this end, this paper presents a novel two-tiered online optimization to enable a learning-based Resource Allowance System (RAS). To solve optimal server-to-reservation assignment in RAS in an online fashion, the proposed solution leverages a reinforcement learning (RL) agent to make high-level decisions, e.g., how much resource to select from the Main Switch Boards (MSBs), and then a low-level Mixed Integer Linear Programming (MILP) solver to generate the local server-to-reservation mapping, conditioned on the RL decisions. We take into account fault tolerance, server movement minimization, and network affinity requirements and apply the proposed solution to large-scale RAS problems. To provide interpretability, we further train a decision tree model to explain the learned policies and to prune unreasonable corner cases at the low-level MILP solver, resulting in further performance improvement. Extensive evaluations show that our two-tiered solution outperforms baselines such as pure MIP solver by over $15\%$ while delivering $100 imes$ speedup in computation.
研究动机与目标
- 解决大规模数据中心(拥有数百万台服务器)中在线工作负载分配的可扩展性与动态性问题。
- 在大规模故障发生时确保容量保障,同时最小化服务器迁移与资源冗余。
- 克服混合整数规划(MILP)在实时、动态环境中因计算成本高和决策空间庞大而带来的局限性。
- 设计一种可扩展的两级优化框架,实现在系统动态环境下的长期性能优化。
- 将深度强化学习与MILP相结合,实现在真实云系统中的高效、实用化部署。
提出的方法
- 设计两级架构:高层DRL智能体对每个预留请求做出序列化资源供给决策,而底层MILP求解器负责将预留映射到具体服务器。
- DRL智能体通过动作转换器(softmax与指数函数)将决策映射为具体的MSB级别服务器预留,从而在减小的动作空间中运行。
- 底层MILP最小化机架级别的资源冗余与服务器迁移成本,并将DRL智能体的输出作为约束条件。
- 通过按服务器类型对问题进行解耦,简化优化过程并提升可扩展性。
- 实现两种变体:单个DRL智能体与并行DRL智能体,均用于性能与可扩展性评估。
- 使用模拟环境对框架进行训练与测试,以模拟真实数据中心的动态行为与故障场景。
实验结果
研究问题
- RQ1基于DRL的方法是否能在大规模约束下,实现在线、动态数据中心资源分配的长期最优性能?
- RQ2两级设计在拥有数百万个决策变量的系统中,如何显著降低DRL的计算负担?
- RQ3在成本、延迟与可扩展性方面,所提方法相较于MIP求解器与启发式方法的优越程度如何?
- RQ4动作转换器在真实部署中如何提升DRL决策的可行性与效率?
- RQ5在不同运行条件下,服务器迁移成本、资源冗余与容量保障之间存在何种权衡?
主要发现
- 所提出的两级DRL方法在30轮决策下测试时间仅为26秒,相比MIP求解器接近一小时的耗时,计算时间减少了90%。
- 该方法相比MIP求解器整体成本降低15%,在最小化资源冗余与迁移方面展现出更优的优化性能。
- 并行智能体变体在10,000台服务器系统上的训练时间为56分钟,表明其在大规模部署中具备可管理的可扩展性。
- 系统在各百分位数下均保持最低的容量冗余,且从未违反冗余约束,确保了强大的可靠性。
- 随着服务器迁移成本上升,总迁移次数减少,尽管资源分布与冗余略有增加,验证了优化中合理的权衡关系。
- 单智能体与并行智能体变体性能相当,验证了DRL设计在不同训练配置下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。