[论文解读] High throughput data center topology design
本文首次为在均匀流量下使用相同交换机的同构数据中心网络建立了非平凡的吞吐量上限,表明随机拓扑在吞吐量上可接近该上限的几个百分点以内。基于此洞察,本文设计了异构拓扑,在真实部署(如VL2)中使用现有设备实现了高达43%的吞吐量提升。
With high throughput networks acquiring a crucial role in supporting data-intensive applications, a variety of data center network topologies have been proposed to achieve high capacity at low cost. While this work explores a large number of design points, even in the limited case of a network of identical switches, no proposal has been able to claim any notion of optimality. The case of heterogeneous networks, incorporating multiple line-speeds and port-counts as data centers grow over time, introduces even greater complexity.In this paper, we present the first non-trivial upper-bound on network throughput under uniform traffic patterns for any topology with identical switches. We then show that random graphs achieve throughput surprisingly close to this bound, within a few percent at the scale of a few thousand servers. Apart from demonstrating that homogeneous topology design may be reaching its limits, this result also motivates our use of random graphs as building blocks for design of heterogeneous networks. Given a heterogeneous pool of network switches, we explore through experiments and analysis, how the distribution of servers across switches and the interconnection of switches affect network throughput. We apply these insights to a real-world heterogeneous data center topology, VL2, demonstrating as much as 43% higher throughput with the same equipment.
研究动机与目标
- 为在均匀流量下使用相同交换机的任何数据中心网络拓扑建立理论吞吐量上限。
- 研究现有拓扑(特别是随机图)在实际中是否接近该理论极限。
- 将同构网络的洞察扩展至具有不同交换机线速率和端口数量的异构数据中心。
- 优化异构网络中的服务器分布与交换机互连方式,以最大化吞吐量。
- 在真实世界的数据中心拓扑(VL2)中验证所提出的设计,展示在不增加额外硬件的情况下实现显著的吞吐量提升。
提出的方法
- 推导出在均匀流量模式下,由相同交换机构成的任意拓扑的非平凡理论吞吐量上限。
- 采用随机图模型作为候选拓扑,评估其接近理论吞吐量上限的程度。
- 分析交换机异质性(特别是线速率和端口数量差异)对端到端网络吞吐量的影响。
- 通过仿真和分析建模,研究服务器在交换机间的分布方式以及交换机互连模式的影响。
- 将推导出的设计原则应用于重构真实世界的VL2数据中心拓扑,重点优化交换机级资源分配与互连结构。
- 通过使用相同物理设备对比原始拓扑与优化后拓扑的实验,验证性能提升效果。
实验结果
研究问题
- RQ1在均匀流量下,由相同交换机构成的任意拓扑所能实现的理论最大吞吐量是多少?
- RQ2在实际规模的数据中心中,基于随机图的拓扑在多大程度上接近该理论吞吐量上限?
- RQ3交换机异质性(特别是线速率和端口数量的差异)如何影响端到端网络吞吐量?
- RQ4如何最优地分配服务器到异构交换机并设计互连模式,以最大化吞吐量?
- RQ5所提出的设计原则是否能在不增加额外硬件的情况下,实现在真实世界数据中心(如VL2)中显著提升吞吐量?
主要发现
- 本文首次为在均匀流量下使用相同交换机的数据中心网络建立了非平凡的理论吞吐量上限。
- 在大规模场景下,随机图拓扑的吞吐量可接近该理论上限的几个百分点以内,表明同构设计可能已接近其性能极限。
- 在异构网络中,服务器在交换机间的分布方式以及互连结构对吞吐量有显著影响,最优配置可带来显著性能提升。
- 当应用于真实世界的VL2拓扑时,所提出的设计在仅使用现有硬件且不增加设备的情况下,将网络吞吐量提升了高达43%。
- 结果表明,通过精心设计交换机级资源分配与互连规划,即使不升级物理基础设施,也能实现显著的性能提升。
- 该理论上限可作为基准,表明当前同构设置下的设计已接近理论最优,但在异构配置中仍存在巨大优化空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。