[論文レビュー] Flexible Network Bandwidth and Latency Provisioning in the Datacenter
Parley は、複数ノードにまたがるサービスを中心としたネットワーク帯域幅および遅延のプロビジョニングシステムであり、データセンターリソースを柔軟に階層的かつ重み付きに共有することを可能にする。グローバルな可視性を持つ分散型帯域幅ブローカーを用い、マシンおよびラックレベルでのホース容量を動的に割り当てることで、高負荷下でも予測可能な低尾端遅延を実現している。10Gb/sのリンクを備えた90台のマシンで構成されるテストベッドを用いた実証により、その有効性が示された。
Predictably sharing the network is critical to achieving high utilization in the datacenter. Past work has focussed on providing bandwidth to endpoints, but often we want to allocate resources among multi-node services. In this paper, we present Parley, which provides service-centric minimum bandwidth guarantees, which can be composed hierarchically. Parley also supports service-centric weighted sharing of bandwidth in excess of these guarantees. Further, we show how to configure these policies so services can get low latencies even at high network load. We evaluate Parley on a multi-tiered oversubscribed network connecting 90 machines, each with a 10Gb/s network interface, and demonstrate that Parley is able to meet its goals.
研究の動機と目的
- アプリケーションが多様な性能要件を持つ多テナントデータセンタにおいて、柔軟でサービス単位の帯域幅および遅延保証のニーズに対応すること。
- 従来のシステムが VM 単位またはテナント単位の帯域幅保証しか提供しないという限界を克服し、サービス間で階層的かつ重み付きの共有を可能にすること。
- グローバルな帯域幅可視性を活用してピークネットワーク利用率を動的に制御することで、遅延に敏感なサービスに対して予測可能な低尾端遅延を実現すること。
- グローバルな共有目標をローカルなラックおよびマシンレベルの割り当て問題に分解できるスケーラブルで分散型のランタイムシステムを設計すること。
- 静的帯域幅保証と、実際のトラフィックパターンに応じて適応する動的で重み付きの共有ポリシーを両立させ、アップリンク帯域幅の過剰コミットを避けること。
提案手法
- サービスがエンドポイントから構成され、マシン、ラック、ファブリックレベルで帯域幅の割り当てがネストされた階層的共有モデルを導入する。
- マシンレベル、ラックレベル、ファブリックレベルの利用状況メトリクスに基づき、定期的に各 VM のホース容量を調整する分散型「帯域幅ブローカー」を採用する。
- データプレーンでエンドツーエンドの混雑制御を実装し、ホース容量を強制することで、フロー単位の状態に依存せずに予測可能なパフォーマンスを確保する。
- ラックレベルで重み付き最大最小公平性モデルを適用し、VM 間で余剰帯域幅を相対的な重みと現在の利用状況に基づいて共有する。
- トラフィックモデルを活用して、自身および共存するサービスの帯域幅割り当てに基づき、サービスの尾端遅延を予測し、能動的な容量計画を可能にする。
- オープンソースの EyeQ システムを拡張し、グローバルな可視性と動的プロビジョニングを追加しながら、そのコアな混雑制御メカニズムを維持する。
実験結果
リサーチクエスチョン
- RQ1ネットワーク帯域幅を個々のエンドポイントや VM ではなく、複数ノードにまたがるサービス間で柔軟に共有する方法は何か?
- RQ2スケーラブルかつ分散的にデータセンターネットワーク全体にまたがって、階層的かつ重み付きの帯域幅共有ポリシーを効果的に実装できるか?
- RQ3帯域幅集約的なワークロードと同時に実行されている場合でも、高負荷下においても遅延に敏感なサービスに対して予測可能な低尾端遅延を実現できるか?
- RQ4動的帯域幅割り当てが RPC の完了時間に与える影響は何か?また、公平性と遅延の両立を図るためのレート制御のチューニング方法は?
- RQ5集中型ポリシーを、グローバルな公平性およびパフォーマンス保証を維持したまま、ローカルで分散された意思決定に分解できる範囲はどの程度か?
主な発見
- Parley は階層的帯域幅共有を効果的にサポートしており、DFS のようなサービスは 6Gb/s から 8Gb/s の帯域幅を割り当てられ、非支払い VM は重み付き最大最小方式でラックあたり最大 1Gb/s を共有する。
- 高負荷下でも予測可能な尾端遅延を維持しており、ほとんどの設定で 99 パーセンタイル遅延が 10ms 未満に保たれている。ただし、ラックブローカーなどの重要なコンponent の障害時には遅延が急増する。
- 90 台のマシンと 10Gb/s インターフェースを用いた実験では、Parley はアップリンク帯域幅の過剰コミットを回避しながら高いネットワーク利用率を達成し、EyeQ の静的割り当て方式を上回った。
- Parley の動的プロビジョニングにより、非アクティブまたは軽負荷のサービスによる帯域幅の無駄が防止され、固定の VM 単位の上限と比較して効率的なリソース利用が可能になった。
- 複数のサービスが帯域幅を競合する状況下でも、ラックアップリンクでのピーク利用率を制御することで、尾端遅延を制限できることを実証した。
- 正確なレート制限と RPC 完了時間の間にトレードオフが存在する:過度なレート制御は完了時間を倍増させる可能性があるため、遅延に敏感なワークロードでは、バーストサイズの設定が不可欠である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。