Skip to main content
QUICK REVIEW

[论文解读] Deconstructing the Tail at Scale Effect Across Network Protocols

Akshitha Sriraman, Sihang Liu|arXiv (Cornell University)|Jan 10, 2017
Cloud Computing and Resource Management参考文献 19被引用 5
一句话总结

本文識別出作業系統核心的 TCP/UDP 協定堆疊是網路協定中極端尾部延遲的主要來源,即使在排除網路擁塞與協定複雜性的情況下依然如此。透過在 TCP-IP、UDP-IP 和 RDMA 上進行受控實驗,顯示即使無連線的 UDP-IP 也出現巨大的 110 倍尾部延遲尖峰,而 RDMA —— 繞過作業系統核心 —— 則顯示可忽略的尾部延遲,證實作業系統協定堆疊是現代低延遲系統中效能下降的根本原因。

ABSTRACT

Network latencies have become increasingly important for the performance of web servers and cloud computing platforms. Identifying network-related tail latencies and reasoning about their potential causes is especially important to gauge application run-time in online data-intensive applications, where the 99th percentile latency of individual operations can significantly affect the the overall latency of requests. This paper deconstructs the "tail at scale" effect across TCP-IP, UDP-IP, and RDMA network protocols. Prior scholarly works have analyzed tail latencies caused by extrinsic network parameters like network congestion and flow fairness. Contrary to existing literature, we identify surprising rare tails in TCP-IP round-trip measurements that are as enormous as 110x higher than the median latency. Our experimental design eliminates network congestion as a tail-inducing factor. Moreover, we observe similar extreme tails in UDP-IP packet exchanges, ruling out additional TCP-IP protocol operations as the root cause of tail latency. However, we are unable to reproduce similar tail latencies in RDMA packet exchanges, which leads us to conclude that the TCP/UDP protocol stack within the operating system kernel is likely the primary source of extreme latency tails.

研究动机与目标

  • 探討資料中心規模運算平台所使用網路協定中極端尾部延遲的根本原因。
  • 確定網路擁塞、流量公平性或協定複雜性(例如 TCP 的三次握手機制)是否為觀察到的尾部延遲尖峰的來源。
  • 透過在受控條件下比較 TCP-IP、UDP-IP 和 RDMA,釐清作業系統核心網路協定堆疊的角色。
  • 評估 RDMA 無作業系統介入的情況是否能消除極端尾部延遲,從而指出核心協定堆疊是延遲異常值的主要來源。
  • 挑戰主流觀點,即認為 TCP-IP 因協定複雜性而天然導致比 UDP-IP 更差的尾部延遲。

提出的方法

  • 在 TCP-IP、UDP-IP 和 RDMA 協定上進行受控網路實驗,並保持極低的網路擁塞,以隔離作業系統層級的影響。
  • 在不同頻寬使用率下測量往返時間(RTT),以評估負載對尾部延遲的影響。
  • 使用 UDP-IP 作為對照,以排除 TCP 特有的功能(如流量控制與重傳)為極端尾部延遲尖峰的來源。
  • 比較不同協定的 RTT 分布,特別關注第 99 百分位數延遲與極端異常值(例如 110 倍中位數)。
  • 利用 RDMA 在使用者空間繞過作業系統核心的特性,完全排除核心協定堆疊的參與,以評估基線尾部行為。
  • 應用排除法推理:排除網路因素、TCP 複雜性與使用者模式軟體,使核心協定堆疊成為最可能的元兇。

实验结果

研究问题

  • RQ1當網路擁塞與路由因素被排除時,網路協定中極端尾部延遲的成因為何?
  • RQ2TCP-IP 的額外複雜性(例如三次握手機制、流量控制)是否顯著增加尾部延遲,相比 UDP-IP?
  • RQ3作業系統核心的網路協定堆疊是否可能成為現代低延遲系統中極端延遲異常值的主要來源?
  • RQ4為何 UDP-IP 的往返時間仍會出現巨大的尾部延遲尖峰,即使其缺乏 TCP 的可靠性機制?
  • RQ5RDMA 的核心繞過設計在尾部延遲行為上如何表現?這對極端尾部延遲的根本原因有何啟示?

主要发现

  • 即使在網路未擁塞的情況下,TCP-IP 往返時間的極端尾部延遲仍可高達中位數的 110 倍。
  • UDP-IP 同樣表現出極端的尾部延遲,排除了 TCP 特有的協定操作(如重傳與流量控制)為異常值來源的可能性。
  • RDMA 的往返時間最多僅 150 µs,且無顯著尾部尖峰,顯示作業系統核心協定堆疊是極端延遲尾部的主因。
  • RDMA 無作業系統核心參與,加上 TCP/UDP-IP 中持續存在的尾部延遲,確認作業系統協定堆疊——特別是多重記憶體複製與系統中斷的需求——是主要瓶頸。
  • 本研究挑戰了「TCP-IP 天然導致比 UDP-IP 更差尾部延遲」的假設,因為在相同條件下,兩者均表現出類似的極端尾部行為。
  • 傳統網路協定設計原本是為較舊、較慢的 CPU 優化,如今其數毫秒的額外開銷不再被計算延遲所掩蓋,進而在現代系統中顯現為毫秒級的尾部延遲。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。