[论文解读] Characterizing Off-path SmartNIC for Accelerating Distributed Systems
本文首次全面表征了离路SmartNIC的通信路径异质性,聚焦于Bluefield-2中的通信路径异质性。通过分析主机、SoC与NIC之间多种RDMA和DMA路径的性能,提出多路径卸载策略,使LineFS和DrTM-KV的性能分别提升最多30%和25%,归因于SmartNIC带宽的更好利用以及网络放大的减少。
SmartNICs have recently emerged as an appealing device for accelerating distributed systems. However, there has not been a comprehensive characterization of SmartNICs, and existing designs typically only leverage a single communication path for workload offloading. This paper presents the first holistic study of a representative off-path SmartNIC, specifically the Bluefield-2, from a communication-path perspective. Our experimental study systematically explores the key performance characteristics of communication among the client, on-board SoC, and host, and offers insightful findings and advice for designers. Moreover, we propose the concurrent use of multiple communication paths of a SmartNIC and present a pioneering guideline to expose new optimization opportunities for various distributed systems. To demonstrate the effectiveness of our approach, we conducted case studies on a SmartNIC-based distributed file system (LineFS) and an RDMA-based disaggregated key-value store (DrTM-KV). Our experimental results show improvements of up to 30% and 25% for LineFS and DrTM-KV, respectively.
研究动机与目标
- 系统性地表征离路SmartNIC中多种通信路径的性能差异,特别是Bluefield-2中的情况。
- 识别由主机CPU与SmartNIC的SoC之间架构异质性引发的性能瓶颈与异常。
- 揭示单路径卸载策略的局限性,即无法充分利用SmartNIC的全部带宽与计算潜力。
- 提出多路径优化指南,以提升分布式系统中的资源利用率并减少网络放大。
- 通过基于SmartNIC的文件系统(LineFS)和基于RDMA的键值存储(DrTM-KV)的案例研究,验证所提方法的有效性。
提出的方法
- 对所有主要通信路径(NIC到SoC、SoC到主机、主机到SoC、NIC到主机)进行了系统性的性能测量,采用RDMA和DMA技术。
- 分析硬件层面差异(如PCIe MTU、内存访问路径、DMA引擎能力)对路径性能的影响。
- 发现由于延迟更低且PCIe跳数更少,NIC到SoC的RDMA路径比到主机快最多1.48倍。
- 发现当SoC的PCIe MTU或内存访问路径与主机不匹配时,SoC相关路径的带宽最多下降48%。
- 提出一种多路径卸载策略,根据工作负载动态选择最优路径,避免资源争用并最大化吞吐量。
- 在两个真实系统中实现并评估该方法:LineFS(分布式文件系统)和DrTM-KV(去耦键值存储),使用相同的SmartNIC硬件。
实验结果
研究问题
- RQ1在不同工作负载和配置下,离路SmartNIC中不同通信路径(如NIC–SoC、SoC–host等)的性能特征如何比较?
- RQ2哪些架构因素(如PCIe MTU、内存访问模式、DMA引擎能力)会导致涉及SoC的路径出现性能异常?
- RQ3为何单路径卸载无法充分利用SmartNIC的带宽与计算能力?其根本瓶颈是什么?
- RQ4多个通信路径之间的交互(如PCIe交换机上的争用)如何影响整体系统性能?
- RQ5在真实分布式系统中,多个路径的并发使用能否显著提升端到端性能?
主要发现
- 由于PCIe跳数更少且延迟更低,SmartNIC的RNIC到SoC的RDMA路径比RNIC到主机的路径快最多1.48倍。
- 当SoC的PCIe MTU或内存访问路径与主机不匹配时,SoC相关路径的带宽最多下降48%,原因在于数据包处理效率低下。
- SoC到主机和主机到SoC的RDMA路径仅利用了50%的可用PCIe带宽,因为它们两次经过内部PCIe交换机,导致数据包数量最多增加6倍,远超直接路径。
- 尽管数据包数量更少,但SoC与主机之间的DMA并不总是比RDMA更快,因为SoC上的DMA引擎性能弱于RNIC。
- LineFS通过使用多条路径避免瓶颈并更好地利用200 Gbps的SmartNIC带宽,实现了最多30%的性能提升。
- DrTM-KV通过在多条路径上卸载键值操作,减少了网络放大并提升了吞吐量,实现了最多25%的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。