Skip to main content
QUICK REVIEW

[论文解读] The End of Slow Networks: It's Time for a Redesign

Carsten Binnig, Andrew Crotty|arXiv (Cornell University)|Apr 4, 2015
Cloud Computing and Resource Management参考文献 54被引用 10
一句话总结

本文主张,现代支持RDMA的网络(如InfiniBand FDR/EDR)已消除网络作为性能瓶颈,因此必须对分布式内存数据库管理系统(DBMS)进行根本性重构。本文提出一种新型网络附加内存(NAM)架构,原生利用RDMA实现低延迟、高带宽的数据访问,通过重新思考适用于高速网络的分布式查询处理与事务协议,实现了显著的性能提升——在聚合操作上最高提升3.5倍,在连接操作上最高提升2.5倍。

ABSTRACT

Next generation high-performance RDMA-capable networks will require a fundamental rethinking of the design and architecture of modern distributed DBMSs. These systems are commonly designed and optimized under the assumption that the network is the bottleneck: the network is slow and "thin", and thus needs to be avoided as much as possible. Yet this assumption no longer holds true. With InfiniBand FDR 4x, the bandwidth available to transfer data across network is in the same ballpark as the bandwidth of one memory channel, and it increases even further with the most recent EDR standard. Moreover, with the increasing advances of RDMA, the latency improves similarly fast. In this paper, we first argue that the "old" distributed database design is not capable of taking full advantage of the network. Second, we propose architectural redesigns for OLTP, OLAP and advanced analytical frameworks to take better advantage of the improved bandwidth, latency and RDMA capabilities. Finally, for each of the workload categories, we show that remarkable performance improvements can be achieved.

研究动机与目标

  • 挑战长久以来认为网络是分布式DBMS主要性能瓶颈的假设,该假设曾驱动系统设计以最小化节点间通信。
  • 证明现代RDMA网络(如InfiniBand FDR/EDR)的带宽已与内存带宽相当甚至超过,使网络优化设计变得至关重要。
  • 提出一种新型架构范式——网络附加内存(NAM),将网络视为共享内存访问的一等资源,实现高效横向扩展与低延迟数据共享。
  • 表明传统优化技术(如避免通信、复杂预处理)已不再最优,应被RDMA感知算法取代。
  • 在OLTP与OLAP工作负载上评估NAM架构,证明其在数据倾斜与高选择性场景下具备更优性能与更强鲁棒性。

提出的方法

  • 设计新型NAM(网络附加内存)架构,支持跨节点直接、低延迟地通过RDMA访问远程内存,将网络视为共享内存池。
  • 实现RDMA感知的查询算子(如RDMA聚合、RRJ连接),充分利用高网络带宽与低延迟,避免数据重分布或复制。
  • 使用RDMA调用接口实现直接内存访问与原子操作,实现高效协调,无需集中式协调器或昂贵的同步机制。
  • 针对NAM模型优化分布式算子,支持细粒度并行与工作窃取,高效应对数据倾斜。
  • 在真实硬件(双路Xeon E5v2搭配FDR 4× InfiniBand)上对原型系统进行OLTP与OLAP工作负载基准测试,测量端到端性能。
  • 在不同数据倾斜与选择性条件下,将基于NAM的设计与经典分布式DBMS模式(如分层聚合、块嵌套循环连接)进行对比。

实验结果

研究问题

  • RQ1在现代RDMA网络(如InfiniBand FDR/EDR)环境下,网络在分布式内存DBMS中在多大程度上已不再是性能瓶颈?
  • RQ2如何重构分布式DBMS架构,以充分挖掘RDMA网络的高带宽与低延迟优势,而非避免网络通信?
  • RQ3网络附加内存(NAM)架构是否能比传统无共享或共享内存模型实现更高效、可扩展的分布式查询处理?
  • RQ4与传统分布式算子相比,RDMA感知查询算子(如聚合、连接)在高选择性与数据倾斜场景下的表现如何?
  • RQ5在面向网络优化的DBMS中,本地处理与远程内存访问之间的性能权衡是什么?这些权衡如何建模与优化?

主要发现

  • 在InfiniBand FDR 4×环境下,网络带宽(最高达37.5 GB/s)与内存带宽(4条DDR3-1600通道合计51.2 GB/s)相当甚至更高,使网络成为可行的性能资源。
  • 微基准测试表明,网络传输现在受限于内存带宽而非网络带宽,表明现代系统中内存与网络已实现平衡。
  • RDMA聚合在高选择性分组聚合工作负载上相比传统分层聚合最高实现3.5倍加速,且随着不同键值数量增加,运行时间增长更缓慢。
  • 所提出的RRJ(RDMA优化的范围-哈希连接)相比传统RDMA连接算法最高实现2.5倍性能提升,尤其在高选择性且无需重分区场景下表现更优。
  • NAM架构支持无需重分区的高效横向扩展,支持细粒度并行,通过工作窃取机制提升在数据倾斜下的鲁棒性。
  • 原型系统表明,传统假设(如避免分布式事务、最小化通信)在高速RDMA环境中已不再成立,必须从零开始设计新算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。