Skip to main content
QUICK REVIEW

[论文解读] Measuring and Understanding Throughput of Network Topologies

Jyothi Sangeetha Abdu, Ankit Singla|arXiv (Cornell University)|Feb 11, 2014
Cloud Computing and Resource Management被引用 9
一句话总结

本文提出一个框架,通过使用合成、现实世界和接近最坏情况的流量矩阵(TMs)来基准测试网络拓扑的吞吐量,引入一种启发式方法生成接近最坏情况的TMs,以揭示拓扑的真实性能极限。研究发现,在规模较大时,基于展开图的拓扑(如Jellyfish、Slim Fly)在最坏情况和现实世界工作负载下显著优于胖树拓扑,当拓扑规模相同时,性能差距最高可达65%。

ABSTRACT

High throughput is of particular interest in data center and HPC networks. Although myriad network topologies have been proposed, a broad head-to-head comparison across topologies and across traffic patterns is absent, and the right way to compare worst-case throughput performance is a subtle problem. In this paper, we develop a framework to benchmark the throughput of network topologies, using a two-pronged approach. First, we study performance on a variety of synthetic and experimentally-measured traffic matrices (TMs). Second, we show how to measure worst-case throughput by generating a near-worst-case TM for any given topology. We apply the framework to study the performance of these TMs in a wide range of network topologies, revealing insights into the performance of topologies with scaling, robustness of performance across TMs, and the effect of scattered workload placement. Our evaluation code is freely available.

研究动机与目标

  • 为解决在不同流量模式和拓扑之间缺乏标准化、开放的网络拓扑吞吐量比较框架的问题。
  • 识别并生成接近最坏情况的流量矩阵,以暴露网络拓扑的真实最坏情况性能极限。
  • 评估并比较10种数据中心和HPC拓扑在真实、合成和最坏情况TMs下的吞吐量性能。
  • 挑战基于切分的度量指标(如割带宽、最小割)能可靠预测最坏情况吞吐量的假设。
  • 为未来拓扑设计与评估提供可复现、开源的基准。

提出的方法

  • 开发一种启发式算法,通过最大化网络链路中的流量拥塞,采用贪心迭代方法生成接近最坏情况的流量矩阵。
  • 采用基于线性规划(LP)的精确吞吐量计算方法,以测量任意给定TM下的性能,实现精确比较。
  • 对小型拓扑采用暴力计算方法,验证最坏情况吞吐量可超过最小割值,证明切分度量指标不足以作为可靠预测工具。
  • 将该框架应用于评估10种拓扑(包括胖树、DCell、Jellyfish、Slim Fly和Long Hop)在真实Facebook数据中心TM、合成TM和生成的最坏情况TM下的表现。
  • 在仿真中实现多路径路由(类似ECMP),以反映真实部署条件,避免因单路径路由方案带来的偏差。
  • 通过复现先前研究的方法并识别因拓扑规模不等和吞吐量估计不准确导致的差异,与已有研究进行对比。

实验结果

研究问题

  • RQ1基于切分的度量指标(如割带宽、最小割)能否准确预测网络拓扑中的最坏情况吞吐量?
  • RQ2是否存在一种系统且高效的方法,可为任意给定网络拓扑生成接近最坏情况的流量矩阵?
  • RQ3在最坏情况、现实世界和合成流量模式下,不同拓扑的性能表现如何,尤其是在大规模场景下?
  • RQ4为何先前研究对拓扑性能(如胖树与展开图)的结论存在冲突?这些差异的根源是什么?
  • RQ5工作负载随机化或放置策略在非均匀流量下能在多大程度上提升性能?

主要发现

  • 当拓扑规模相同时,基于展开图的拓扑(如Jellyfish、Long Hop和Slim Fly)在最坏情况吞吐量上比胖树拓扑最高可提升65%,且该性能差距随规模扩大而进一步增加。
  • 在小规模(例如,<1000台服务器)时,DCell及其类似拓扑在所有TM下表现良好,但其优势在规模扩大后逐渐减弱。
  • 割带宽和最小割等切分度量指标无法准确预测最坏情况吞吐量:存在某些拓扑中,更高的切分度量反而对应更低的实际最坏情况吞吐量。
  • 所提出的启发式方法生成的接近最坏情况TMs,其吞吐量可达到理论下限的几个百分点以内,且在速度和可扩展性方面优于先前方法(快6倍,支持的网络规模大8倍)。
  • 通过精确的LP吞吐量计算复现先前研究(如Yuan等人[48])的结果,发现早期研究结果因拓扑规模不等和吞吐量估计不准确而存在偏差,当规模相等时,性能差距扩大至65%。
  • 在非均匀工作负载下,通过机架级工作负载放置随机化可提升性能,表明该策略对数据中心任务调度具有实际意义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。