Skip to main content
QUICK REVIEW

[論文レビュー] Measuring and Understanding Throughput of Network Topologies

Jyothi Sangeetha Abdu, Ankit Singla|arXiv (Cornell University)|Feb 11, 2014
Cloud Computing and Resource Management被引用数 9
ひとこと要約

本論文は、合成的・実世界的・近い最悪ケースのトラフィック行列(TM)を用いてネットワークトポロジーのスループットをベンチマークするフレームワークを提案する。近い最悪ケースのTMを生成するヒューリスティックを導入し、トポロジーの真の制限を明らかにする。等サイズのトポロジーにおいて、特に最悪ケースおよび実世界ワークロード下で、エクスパンダベースのトポロジー(例:Jellyfish、Slim Fly)がファットツリーを著しく上回ることを発見した。性能差は最大65%に達する。

ABSTRACT

High throughput is of particular interest in data center and HPC networks. Although myriad network topologies have been proposed, a broad head-to-head comparison across topologies and across traffic patterns is absent, and the right way to compare worst-case throughput performance is a subtle problem. In this paper, we develop a framework to benchmark the throughput of network topologies, using a two-pronged approach. First, we study performance on a variety of synthetic and experimentally-measured traffic matrices (TMs). Second, we show how to measure worst-case throughput by generating a near-worst-case TM for any given topology. We apply the framework to study the performance of these TMs in a wide range of network topologies, revealing insights into the performance of topologies with scaling, robustness of performance across TMs, and the effect of scattered workload placement. Our evaluation code is freely available.

研究の動機と目的

  • 多様なトラフィックパターンとトポロジー間でネットワークトポロジーのスループットを比較するための標準的でオープンなフレームワークの欠如に応えること。
  • ネットワークトポロジーの真の最悪ケース性能限界を露呈する近い最悪ケースのトラフィック行列を特定・生成すること。
  • 実際のデータセンターデータ、合成的TM、最悪ケースTMの3つの環境下で、10種類のデータセンターやHPC用トポロジーのスループット性能を評価・比較すること。
  • カットに基づく指標(例:バイセクション帯域幅、スパーストカット)が最悪ケーススループットを信頼性高く予測できるという仮定に疑問を呈すること。
  • 将来のトポロジー設計と評価のための再現可能でオープンソースのベンチマークを提供すること。

提案手法

  • グリーディで反復的なアプローチを用いて、ネットワークリンク全体のフロー混雑度を最大化することで、近い最悪ケースのトラフィック行列を生成するヒューリスティックなアルゴリズムを開発する。
  • 線形計画法(LP)に基づく正確なスループット計算を用いて、任意のTM下でのパフォーマンスを測定し、正確な比較を可能にする。
  • 小規模トポロジーにおいてブルートフォース計算を実施し、最悪ケーススループットがスパーストカット値を上回ることを検証することで、カット指標が不十分な予測因子であることを立証する。
  • フレームワークを用いて、ファットツリー、DCell、Jellyfish、Slim Fly、Long Hopなどを含む10種類のトポロジーを、実際のFacebookデータセンターデータTM、合成TM、生成された最悪ケースTMの下で評価する。
  • シミュレーションにマルチパスルーティング(ECMPに類似)を実装し、単一路線ルーティング方式に起因するバイアスを回避し、実世界の展開状況を反映する。
  • 過去の研究を再現することで、トポロジーのサイズが不均等であることやスループット推定が最適でないことが原因で生じる差異を特定する。

実験結果

リサーチクエスチョン

  • RQ1バイセクション帯域幅やスパーストカットといったカット指標は、ネットワークトポロジーの最悪ケーススループットを正確に予測できるか?
  • RQ2任意のネットワークトポロジーに対して、系統的かつ効率的な近い最悪ケースのトラフィック行列を生成する方法は何か?
  • RQ3異なるトポロジーは、最悪ケース、実世界的、合成的トラフィックパターン下で、特にスケールアップした場合にどのように性能を発揮するか?
  • RQ4なぜ過去の研究ではトポロジー性能に関する矛盾した結果(例:ファットツリー対エクスパンダ)が報告されたのか?その原因は何か?
  • RQ5非一様トラフィック下で、ワークロードのランダム化や配置戦略を用いることで、性能はどの程度向上するのか?

主な発見

  • 等サイズのトポロジーにおいて、Jellyfish、Long Hop、Slim Flyといったエクスパンダベースのトポロジーは、最悪ケーススループットでファットツリーを最大65%上回る。性能差はスケールアップに伴い拡大する。
  • 小規模(例:1000サーバー未満)では、DCellや類似トポロジーはすべてのTMで良好なパフォーマンスを示すが、スケールアップに伴いその利点は薄れる。
  • バイセクション帯域幅やスパーストカットといったカット指標は最悪ケーススループットを予測できない。あるトポロジーでは、高いカット指標を持つにもかかわらず、実際の最悪ケーススループットは低くなる例が存在する。
  • 提案されたヒューリスティックは、理論的下限値から数パーセント以内のスループットを達成する近い最悪ケースTMを生成でき、速度とスケーラビリティにおいて従来手法を上回る(6倍速く、8倍大きなネットワークを処理可能)。
  • 正確なLPベースのスループット計算を用いて過去の研究(例:Yuanら[48])を再現した結果、初期の結果はトポロジーのサイズが不均等であることやスループット推定が不正確であることによるバイアスが原因であり、サイズが等しい場合に性能差が65%にまで拡大することが判明した。
  • 非一様トラフィック下でラックレベルでのワークロード配置をランダム化することでパフォーマンスが向上する。これは、データセンターにおけるタスク配置戦略に実用的意義を示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。