Skip to main content
QUICK REVIEW

[論文レビュー] ATP: a Datacenter Approximate Transmission Protocol.

Ke Liu, Shin-Yeh Tsai|arXiv (Cornell University)|Jan 7, 2019
Cloud Computing and Resource Management参考文献 39被引用数 5
ひとこと要約

ATPは、制御されたパケット損失を用いて損失性ネットワークを活用できる新しいデータセンターネットワークプロトコルであり、損失に基づくレート制御により帯域幅の利用を最大化すると同時に、公平な共有を確保し、TCPベースのソリューションと比較して実行時間を最大74.6%短縮するとともに、UDPと比較して精度を最大94%向上する。

ABSTRACT

Many datacenter applications such as machine learning and streaming systems do not need the complete set of data to perform their computation. Current approximate applications in datacenters run on a reliable network layer like TCP. To improve performance, they either let sender select a subset of data and transmit them to the receiver or transmit all the data and let receiver drop some of them. These approaches are network oblivious and unnecessarily transmit more data, affecting both application runtime and network bandwidth usage. On the other hand, running approximate application on a lossy network with UDP cannot guarantee the accuracy of application computation. We propose to run approximate applications on a lossy network and to allow packet loss in a controlled manner. Specifically, we designed a new network protocol called Approximate Transmission Protocol, or ATP, for datacenter approximate applications. ATP opportunistically exploits available network bandwidth as much as possible, while performing a loss-based rate control algorithm to avoid bandwidth waste and re-transmission. It also ensures bandwidth fair sharing across flows and improves accurate applications' performance by leaving more switch buffer space to accurate flows. We evaluated ATP with both simulation and real implementation using two macro-benchmarks and two real applications, Apache Kafka and Flink. Our evaluation results show that ATP reduces application runtime by 13.9% to 74.6% compared to a TCP-based solution that drops packets at sender, and it improves accuracy by up to 94.0% compared to UDP.

研究の動機と目的

  • 現在のアプロキマートアプリケーションが送信元でデータを破棄するか、TCPのような信頼性の高いプロトコルを介してすべてのデータを送信するという非効率な点を是正すること。
  • ネットワークに無関心なアプロキマートデータ伝送を排除するため、ネットワーク状態に動的に適応するプロトコルを設計すること。
  • アプリケーションの精度を維持しながらネットワークオーバーヘッドを低減する形で、制御されたパケット損失を可能にする仕組みを提供することで、アプロキマートアプリケーションのパフォーマンスを向上させること。
  • スイッチのバッファ競合を最小限に抑えることで、アプロキマートフローと正確なフローの間で帯域幅を公平に共有すること。
  • 送信元でのデータ破棄を伴うTCPベースのソリューションと、UDPベースのアプロachesの両方を上回るパフォーマンスを、アプロキマートワークロードの観点から実現すること。

提案手法

  • 利用可能な帯域幅を活用できるように、制御的・機会的パケット損失を許容する損失性トランスポートプロトコルとしてATPを設計すること。
  • 観察されたパケット損失に基づいて送信レートを調整する損失に基づくレート制御アルゴリズムを実装し、再送信を回避し、帯域幅の無駄を減らすこと。
  • アプロキマートフローがスイッチバッファを独占しないように公平性メカニズムを統合し、正確なフローのための余裕を確保すること。
  • 損失イベントを監視するフィードバックループを用いて送信レートを調整し、混雑を避ける一方で高い利用度を維持すること。
  • Apache Kafka や Flink などの実際のデータセンタワークロードを用いて、シミュレーションおよび実環境の両方でATPを展開すること。
  • 性能と精度のトレードオフを明確にするために、ATPをTCP(送信元でのデータ破棄あり)およびUDPと比較して評価すること。

実験結果

リサーチクエスチョン

  • RQ1送信元でのデータ破棄を伴うTCPと比較して、損失性トランスポートプロトコルは、アプロキマートデータセンターアプリケーションの実行時間を改善できるか?
  • RQ2ATPの損失に基づくレート制御は、従来の混雑制御と比較して、帯域幅利用効率と再送信回避の観点でどのように異なるか?
  • RQ3UDPがパケット損失の制御を持たないのと比較して、ATPはアプリケーションの精度をどの程度向上させるか?
  • RQ4ATPは、バッファ制限環境において正確なアプリケーションとネットワークリソースを公平に共有できるか?
  • RQ5ストリーミングや機械学習パイプラインを含む多様なワークロードにおいて、ATPのパフォーマンス向上はどの程度か?

主な発見

  • ATPは、送信元でパケットを破棄するTCPベースのソリューションと比較して、アプリケーションの実行時を13.9%〜74.6%短縮する。
  • UDPがパケット損失の制御を持たないのと比較して、ATPはアプリケーションの精度を最大94.0%向上させる。
  • ATPは、制御された損失を活用することで、利用可能な容量を効果的に活用し、再送信を回避し、ネットワーク混雑を低減することで、高い帯域幅利用効率を達成する。
  • ATPはスイッチバッファ領域の公平な共有を確保し、正確なフローのためのバッファ容量を予約することで、正確なアプリケーションのパフォーマンスを向上させる。
  • ATPは、マクロベンチマークおよびApache Kafka や Flink などの実アプリケーションにおいて、一貫したパフォーマンス向上を示す。
  • 損失に基づくレート制御メカニズムは、スループットと損失のバランスを効果的にとらえ、過度な再送信を伴わずに高いパフォーマンスを維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。