Skip to main content
QUICK REVIEW

[論文レビュー] A Characterization of the SPARC T3-4 System

M.W. van Tol|arXiv (Cornell University)|Jun 15, 2011
Parallel Computing and Optimization Techniques参考文献 4被引用数 4
ひとこと要約

この論文は、64コアのSPARC T3-4システムの性能を、Intel XeonおよびAMD Opteronの2つのx86ベースシステムと比較して評価しており、計算スルーレートとメモリスルーレート、POSIXスレッドの挙動、および細粒度マルチスレーディングにおけるスケーラビリティを測定している。T3-4は512スレッドまで優れたスケーラビリティを示し、ハードウェアの乗算-積分型命令サポートのおかげでメモリ帯域幅と浮動小数点ワークロードで優れた性能を発揮するが、高スレッド数でのアトミックな比較・交換(CAS)演算では深刻な性能低下を示している。

ABSTRACT

This technical report covers a set of experiments on the 64-core SPARC T3-4 system, comparing it to two similar AMD and Intel systems. Key characteristics as maximum integer and floating point arithmetic throughput are measured as well as memory throughput, showing the scalability of the SPARC T3-4 system. The performance of POSIX threads primitives is characterized and compared in detail, such as thread creation and mutex synchronization. Scalability tests with a fine grained multithreaded runtime are performed, showing problems with atomic CAS operations on such physically highly parallel systems.

研究の動機と目的

  • マススケール並列ワークロード下における64コアSPARC T3-4システムの性能限界を評価すること。
  • T3-4の計算スルーレートおよびメモリスルーレートを、2つのx86ベースの基準システム(Intel XeonおよびAMD Opteron)と比較すること。
  • POSIXスレッドプリミティブ(特にスレッド作成と同期)がT3-4システム上でどのように動作するかを調査すること。
  • 細粒度マルチスレーディングランタイム(SVP-ptl)がT3-4上で高スレッド数下でどのようにスケーリングするかを評価すること。
  • 特にCMTアーキテクチャにおけるアトミック演算関連のパフォーマンスボトルネックを特定すること。

提案手法

  • 1〜512スレッドの範囲で整数および浮動小数点演算スルーレートを測定する制御された実験を実施した。
  • スレッド数の増加に伴うメモリ帯域幅の飽和点を特定するため、メモリ帯域幅を多く消費するワークロードを用いてメモリスルーレートを測定した。
  • 3つのシステムすべてでPOSIXスレッドプリミティブ(スレッド作成、ミューテックス、条件変数同期)のパフォーマンスをベンチマークした。
  • SVP-ptlベースのアプリケーション(再帰的FFTおよび行列乗算)を実行し、細粒度並列処理下でのスケーラビリティを評価した。
  • スレッドマッピング戦略を用いて、OSスケジューリングの挙動とコア間の負荷分散を評価した。
  • 特にアトミック比較・交換(CAS)演算に注目し、極度のスレッド数下でのパフォーマンス劣化を分析した。

実験結果

リサーチクエスチョン

  • RQ1T3-4システムは、ハードウェアスレッド数が少ないx86ベースシステムと比較して、計算スルーレート(整数および浮動小数点)においてどのようにスケーリングするか?
  • RQ2T3-4で達成可能な最大メモリ帯域幅は何か? また、基準x86システムと比較してどうか?
  • RQ3T3-4におけるPOSIXスレッドプリミティブ(スレッド作成、ミューテックス、条件変数)のパフォーマンスは、Linuxベースのx86システムと比較してどうか?
  • RQ4512のハードウェアスレッドを有するシステムでアトミック比較・交換(CAS)演算を使用した場合、パフォーマンスにどのような影響が生じるか?
  • RQ5T3-4システムは、SVP-ptlのような細粒度マルチスレーディングランタイムを必要とするワークロードを、特に高スレッド数下でどのように処理するか?

主な発見

  • T3-4システムは、512スレッドに達するまで整数および浮動小数点演算ユニットが飽和せず、優れた計算スケーラビリティを示している。
  • T3-4のメモリ帯域幅は約256スレッドで飽和し、両基準システムを2倍の性能で上回っている。
  • 512×512行列乗算を32,768スレッド(5回再帰)で実行した場合、T3-4は最適性能比で20倍の遅延を示したが、X4470とMagny Coursはそれぞれ69倍および174倍の遅延を示した。
  • 単一再帰の行列乗算において、T3-4はx86アーキテクチャに存在しない専用のハードウェア乗算-積分命令のおかげで、両x86システムを上回った。
  • アトミック比較・交換(CAS)演算はT3-4で深刻なパフォーマンス劣化を引き起こし、1回のケースで2分間のフリーズが発生した。これは、より高いスレッド並列度のため、x86システムよりも深刻な影響を受けていた。
  • Solaris上でのT3-4のスレッド作成および同期処理は、Linuxベースのx86システムと比較して著しく遅く、OSランタイムにパフォーマンスボトルネックが存在することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。