Skip to main content
QUICK REVIEW

[論文レビュー] The End of Slow Networks: It's Time for a Redesign

Carsten Binnig, Andrew Crotty|arXiv (Cornell University)|Apr 4, 2015
Cloud Computing and Resource Management参考文献 54被引用数 10
ひとこと要約

この論文は、InfiniBand FDR/EDR などの現代の RDMA 対応ネットワークが、ネットワークを性能ボトルネックとして排除したとして、分散メモリ内 DBMS の根本的な再設計を必要としていると主張している。本論文では、低遅延・高帯域幅なデータアクセスを natively RDMA で活用する新しいネットワークアタッチドメモリ(NAM)アーキテクチャを提案している。このアーキテクチャにより、高速ネットワークを考慮した分散クエリ処理とトランザクションプロトコルの再考が可能となり、集計処理で最大 3.5 倍、ジョイン処理で最大 2.5 倍の性能向上を達成した。

ABSTRACT

Next generation high-performance RDMA-capable networks will require a fundamental rethinking of the design and architecture of modern distributed DBMSs. These systems are commonly designed and optimized under the assumption that the network is the bottleneck: the network is slow and "thin", and thus needs to be avoided as much as possible. Yet this assumption no longer holds true. With InfiniBand FDR 4x, the bandwidth available to transfer data across network is in the same ballpark as the bandwidth of one memory channel, and it increases even further with the most recent EDR standard. Moreover, with the increasing advances of RDMA, the latency improves similarly fast. In this paper, we first argue that the "old" distributed database design is not capable of taking full advantage of the network. Second, we propose architectural redesigns for OLTP, OLAP and advanced analytical frameworks to take better advantage of the improved bandwidth, latency and RDMA capabilities. Finally, for each of the workload categories, we show that remarkable performance improvements can be achieved.

研究の動機と目的

  • 分散 DBMS におけるネットワークが主なボトルネックであるという長年の仮定に挑戦し、その結果、ノード間通信を最小限に抑える設計が採用されてきたことの背景を明らかにすること。
  • 現代の RDMA ネットワーク(例:InfiniBand FDR/EDR)が、メモリ帯域幅と同等またはそれを上回る帯域幅を提供しており、ネットワーク最適化設計が今や不可欠であることを示すこと。
  • ネットワークを共有メモリへのアクセスのための第一級リソースとして扱う新たなアーキテクチャ的パラダイム「ネットワークアタッチドメモリ(NAM)」を提案すること。これにより、効率的なスケールアウトと低遅延データ共有が可能になる。
  • 従来の最適化手法(例:通信を避ける、複雑な事前処理)がもはや最適ではなく、RDMA 対応のアルゴリズムへと置き換えるべきであることを示すこと。
  • OLTP および OLAP ワークロードにおける NAM アーキテクチャの評価を通し、データの偏りや高基数性に強く、優れた性能と耐障害性を発揮することを実証すること。

提案手法

  • ノード間のリモートメモリに対して直接かつ低遅延で RDMA アクセスを可能にする新しい NAM(ネットワークアタッチドメモリ)アーキテクチャの設計。ネットワークを共有メモリプールとして扱う。
  • 高帯域幅および低遅延を活かした RDMA 対応クエリオペレータ(例:RDMA 集計、RRJ ジョイン)の実装。これにより、データのシャッフルやレプリケーションの必要がなくなる。
  • 直接メモリアクセスおよびアトミック操作に RDMA ベルブスを用い、中央集権のコordinater や高コストな同期処理を回避する。
  • NAM モデルにおいてデータの偏りを効率的に処理するため、細粒度並列処理とワーキーステaling を最適化した分散オペレータの設計。
  • 実ハードウェア(FDR 4× InfiniBand 搭載のデュアルソケット Xeon E5v2)を用いて OLTP および OLAP ワークロードでプロトタイプをベンチマークし、エンドツーエンドの性能を測定。
  • データの偏りや基数性の変動を想定し、NAM ベースの設計と従来の分散 DBMS パatters(例:階層的集計、ブロックネストドループジョイン)を比較。

実験結果

リサーチクエスチョン

  • RQ1InfiniBand FDR/EDR などの現代の RDMA ネットワークは、分散メモリ内 DBMS におけるネットワークを性能ボトルネックとして排除できる程度にまで到達しているか。
  • RQ2分散 DBMS アーキテクチャは、ネットワーク通信を避けるのではなく、高帯域幅および低遅延を最大限に活かすようにどのように再設計できるか。
  • RQ3ネットワークアタッチドメモリ(NAM)アーキテクチャは、従来の共有なし(shared-nothing)または共有メモリ(shared-memory)モデルに比べ、よりスケーラブルかつ効率的な分散クエリ処理を実現できるか。
  • RQ4RDMA 対応クエリオペレータ(例:集計、ジョイン)は、高基数性およびデータの偏りがある状況下で、従来の分散オペレータに比べてどのように性能を発揮するか。
  • RQ5ネットワーク最適化 DBMS において、ローカル処理とリモートメモリアクセスの間の性能トレードオフは何か。また、これらをどのようにモデル化・最適化できるか。

主な発見

  • InfiniBand FDR 4× を用いることで、ネットワーク帯域幅(最大 37.5 GB/s)が、4 本の DDR3-1600 チャネルの合計メモリ帯域幅(51.2 GB/s)と同等またはそれを上回り、ネットワークを性能リソースとして利用可能であることが判明した。
  • マイクロベンチマークの結果、ネットワーク転送はもはやネットワーク帯域幅ではなく、メモリ帯域幅によって制限されていることが示され、現代のシステムではメモリとネットワークの両方がバランスしていることが確認された。
  • RDMA 集計は、高基数の GROUP BY クエリに対して、従来の階層的集計に比べ最大 3.5 倍の高速化を達成し、異なるキー数が増加しても実行時間がゆっくりと増加する傾向を示した。
  • 提案された RRJ(RDMA 最適化範囲ハッシュジョイン)は、従来の RDMA ジョインアルゴリズムに比べ、特に高基数性や再パーティショニングが不要な状況で最大 2.5 倍の高速化を実現した。
  • NAM アーキテクチャは、再パーティショニングなしで効率的なスケールアウトを可能にし、細粒度並列処理をサポートし、ワーキーステーリング機構によりデータの偏りに強い耐障害性を発揮した。
  • プロトタイプの評価から、高速な RDMA 環境では従来の仮定(例:分散トランザクションを避ける、通信を最小限に抑える)がもはや成立せず、新しいアルゴリズムは根本から設計しなおされる必要があることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。