Skip to main content
QUICK REVIEW

[论文解读] Expanding across time to deliver bandwidth efficiency and low latency

William M. Mellette, Rajdeep Das|arXiv (Cornell University)|Mar 29, 2019
Interconnection Networks and Systems参考文献 37被引用 19
一句话总结

Opera 是一种动态的、电路交换的数据中心网络,通过快速可重构的、随时间变化的膨胀图(expander graphs)实现小流量的低延迟性能,同时在长时间内为批量流量提供直接的、带宽高效的路径。与成本相当的静态拓扑相比,它在混洗工作负载中实现了高达4倍的吞吐量提升,负载容量提高60%,且对流完成时间的影响可忽略不计。

ABSTRACT

Datacenters need networks that support both low-latency and high-bandwidth packet delivery to meet the stringent requirements of modern applications. We present Opera, a dynamic network that delivers latency-sensitive traffic quickly by relying on multi-hop forwarding in the same way as expander-graph-based approaches, but provides near-optimal bandwidth for bulk flows through direct forwarding over time-varying source-to-destination circuits. The key to Opera's design is the rapid and deterministic reconfiguration of the network, piece-by-piece, such that at any moment in time the network implements an expander graph, yet, integrated across time, the network provides bandwidth-efficient single-hop paths between all racks. We show that Opera supports low-latency traffic with flow completion times comparable to cost-equivalent static topologies, while delivering up to 4x the bandwidth for all-to-all traffic and supporting 60% higher load for published datacenter workloads.

研究动机与目标

  • 解决数据中心网络中低延迟与高带宽需求之间的根本性权衡。
  • 在不牺牲小流量低延迟性能的前提下,消除批量流量多跳转发带来的带宽税。
  • 设计一种可重构网络,在保持低直径连接性以支持延迟敏感流量的同时,随时间实现直接、高带宽的路径。
  • 证明动态电路交换在真实工作负载下,相较于静态拓扑,可在带宽效率和负载容量方面均表现更优。

提出的方法

  • Opera 通过在固定时间间隔内重新配置少量的机架顶部(ToR)交换机上行链路,构建一系列随时间变化的膨胀图。
  • 它确保在任何时刻,网络拓扑都构成一个有效的膨胀图,从而为延迟敏感流量提供低延迟、多跳转发。
  • 批量流量仅在源和目的之间随时间建立直接的单跳电路时才被缓冲并转发。
  • 系统以确定性、循环的方式预先分配机架到机架的电路,以确保所有机架对都能通过直接链路周期性连接。
  • 该设计利用动态重构的膨胀图作为基础网络,以维持低延迟连接性,同时通过时间平均的直接路径实现带宽效率。
  • 该设计通过依赖可预测的周期性重构调度,避免了运行时电路选择或全局流量监控。

实验结果

研究问题

  • RQ1可重构网络是否能在实现接近理想的批量流量带宽效率的同时,维持低延迟性能?
  • RQ2在动态拓扑中,多跳转发的带宽税与时间平均的直接路径优势相比如何?
  • RQ3确定性的周期性重构调度是否能在无需实时流量监控的情况下,同时支持低延迟和高吞吐量性能?
  • RQ4对于真实世界的数据中心工作负载,此类系统相较于成本相当的静态拓扑,可实现多大的吞吐量增益?

主要发现

  • 与成本相当的静态拓扑(如折叠Clos或膨胀图)相比,Opera 在混洗工作负载中实现了高达4倍的吞吐量提升。
  • 对于已发表的、具有偏斜特征的数据中心工作负载,Opera 在保持所有流量大小下等效流完成时间的同时,支持比静态拓扑高60%的负载。
  • Opera 将有效带宽税降低至仅8.4%,远低于现有可重构网络设计中常见的200%–500%的带宽税。
  • Opera 的路由规则集可适配现代 Tofino 65x100GE 交换机的内存限制,即使在大规模数据中心(1,200个机架)中,内存利用率最高可达85.9%。
  • 该系统通过确保膨胀图拓扑始终处于激活状态,从而维持低延迟性能,使小流量能够立即进行多跳转发。
  • 该方法在多种网络规模、工作负载和成本因素下均表现出稳定性,展现出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。