Skip to main content
QUICK REVIEW

[论文解读] ATP: a Datacenter Approximate Transmission Protocol.

Ke Liu, Shin-Yeh Tsai|arXiv (Cornell University)|Jan 7, 2019
Cloud Computing and Resource Management参考文献 39被引用 5
一句话总结

ATP 是一种新颖的数据中心网络协议,使近似应用能够通过可控的丢包利用有损网络,采用基于丢包的速率控制,在最大化带宽利用率的同时确保公平共享,并与基于 TCP 的解决方案相比将运行时间减少高达 74.6%,与 UDP 相比将精度提升高达 94%。

ABSTRACT

Many datacenter applications such as machine learning and streaming systems do not need the complete set of data to perform their computation. Current approximate applications in datacenters run on a reliable network layer like TCP. To improve performance, they either let sender select a subset of data and transmit them to the receiver or transmit all the data and let receiver drop some of them. These approaches are network oblivious and unnecessarily transmit more data, affecting both application runtime and network bandwidth usage. On the other hand, running approximate application on a lossy network with UDP cannot guarantee the accuracy of application computation. We propose to run approximate applications on a lossy network and to allow packet loss in a controlled manner. Specifically, we designed a new network protocol called Approximate Transmission Protocol, or ATP, for datacenter approximate applications. ATP opportunistically exploits available network bandwidth as much as possible, while performing a loss-based rate control algorithm to avoid bandwidth waste and re-transmission. It also ensures bandwidth fair sharing across flows and improves accurate applications' performance by leaving more switch buffer space to accurate flows. We evaluated ATP with both simulation and real implementation using two macro-benchmarks and two real applications, Apache Kafka and Flink. Our evaluation results show that ATP reduces application runtime by 13.9% to 74.6% compared to a TCP-based solution that drops packets at sender, and it improves accuracy by up to 94.0% compared to UDP.

研究动机与目标

  • 为解决当前近似应用效率低下的问题,这些应用要么在发送端丢弃数据,要么通过 TCP 等可靠协议传输全部数据。
  • 通过设计一种能动态适应网络状况的协议,消除近似数据传输中的网络无感知问题。
  • 通过以可控方式引入丢包,提升近似应用的性能,同时保持应用精度并减少网络开销。
  • 通过最小化交换机中的缓冲区争用,确保近似流与准确流之间公平共享带宽。
  • 在运行时间和精度方面,优于基于 TCP 的解决方案(采用发送端丢包)和基于 UDP 的方法,适用于近似工作负载。

提出的方法

  • 设计 ATP 作为一种有损传输协议,允许通过可控的、机会性的丢包来利用可用带宽。
  • 实现基于丢包的速率控制算法,根据观察到的丢包情况调整发送速率,避免重传和带宽浪费。
  • 集成公平性机制,确保近似流不会独占交换机缓冲区,从而为准确流保留缓冲区空间。
  • 使用反馈回路监控丢包事件,并调整发送速率,以在不引发拥塞的情况下保持高利用率。
  • 在仿真环境和真实世界环境中部署 ATP,使用 Apache Kafka 和 Flink 等真实数据中心工作负载。
  • 将 ATP 与 TCP(采用发送端丢包)和 UDP 进行对比,以隔离性能与精度之间的权衡。

实验结果

研究问题

  • RQ1与在发送端丢弃数据的 TCP 相比,有损传输协议能否改善近似数据中心应用的运行时间?
  • RQ2ATP 的基于丢包的速率控制与传统拥塞控制相比,在带宽利用率和避免重传方面表现如何?
  • RQ3与缺乏任何丢包控制机制的 UDP 相比,ATP 在多大程度上提升了应用精度?
  • RQ4ATP 是否能与准确应用公平共享网络资源,特别是在缓冲区受限的环境中?
  • RQ5ATP 在诸如流媒体和机器学习流水线等多样化工作负载中,性能提升如何?

主要发现

  • 与在发送端丢包的基于 TCP 的解决方案相比,ATP 将应用运行时间减少了 13.9% 至 74.6%。
  • 与缺乏任何丢包控制机制的 UDP 相比,ATP 将应用精度提升了高达 94.0%。
  • ATP 通过可控丢包利用可用带宽,避免重传并减少网络拥塞,从而实现更高的带宽利用率。
  • ATP 确保交换机缓冲区空间的公平共享,通过预留缓冲区容量,提升了准确应用的性能。
  • 该协议在宏观基准测试和真实应用(如 Apache Kafka 和 Flink)中均表现出一致的性能提升。
  • 基于丢包的速率控制机制有效平衡了吞吐量与丢包,在不过度重传的情况下维持了高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。