Skip to main content
QUICK REVIEW

[論文レビュー] Performance of Kepler GTX Titan GPUs and Xeon Phi System

Hwancheol Jeong, Weonjong Lee|arXiv (Cornell University)|Nov 4, 2013
Parallel Computing and Optimization Techniques参考文献 2被引用数 4
ひとこと要約

本論文は、高性能コンピューティング、特に格子QCDシミュレーションにおいて、NVIDIAのGeForce GTX TitanとIntelのXeon Phiコプロセッサの性能を評価している。GTX Titanは、Tesla K20Xの1/3の価格で単精度性能4.5 TFLOPSを達成しているが、Xeon Phiは優れたベクトル化サポートと非効率なメモリアクセスのため、性能が10倍も劣り、このようなワークロードには不適切であることが示された。

ABSTRACT

NVIDIA's new architecture, Kepler improves GPU's performance significantly with the new streaming multiprocessor SMX. Along with the performance, NVIDIA has also introduced many new technologies such as direct parallelism, hyper-Q and GPU Direct with RDMA. Apart from other usual GPUs, NVIDIA also released another Kepler 'GeForce' GPU named GTX Titan. GeForce GTX Titan is not only good for gaming but also good for high performance computing with CUDA. Nevertheless, it is remarkably cheaper than Kepler Tesla GPUs. We investigate the performance of GTX Titan and find out how to optimize a CUDA code appropriately for it. Meanwhile, Intel has launched its new many integrated core (MIC) system, Xeon Phi. A Xeon Phi coprocessor could provide similar performance with NVIDIA Kepler GPUs theoretically but, in reality, it turns out that its performance is significantly inferior to GTX Titan.

研究の動機と目的

  • 消費者向けGPUとしてのGeForce GTX Titanの高性能コンピューティングワークロードにおける性能を評価すること。
  • 格子QCDシミュレーションにおいて、GTX Titanの性能をIntel Xeon PhiおよびTesla K20Xと比較すること。
  • KeplerアーキテクチャベースのGPUにおけるCUDAカーネルの最適化戦略を同定すること。
  • Xeon Phiシステムの主な実用的制限、特にベクトル化とメモリアクセスに関する分析。
  • GPU Direct RDMAや直接並列処理といった新規GPU技術の実世界での性能を評価すること。

提案手法

  • GTX 480、GTX Titan、Xeon Phi 5110Pにおける共役勾配(CG)ソルバーの性能をベンチマーク化。
  • 各デバイスで10回実行した際のCG実行時間(秒単位)を測定。
  • スレッド/ブロック構成の最適化、共有メモリ/L1キャッシュの再設定を含むCUDAカーネル最適化を適用。
  • GPU Direct RDMA v2を用いたGPU間データ転送の評価。標準的なcudaMemcpyとの比較を実施。
  • Intelコンパイラを用いてコードをコンパイルし、ベクトル化の課題を評価し、性能への影響を測定。
  • ピークFLOPS計算と実世界のベンチマークを用いて、理論的性能と実際の性能を分析。

実験結果

リサーチクエスチョン

  • RQ1格子QCDシミュレーションにおける二重精度浮動小数点演算において、GTX Titanの性能はTesla K20XおよびXeon Phiと比べてどの程度か?
  • RQ2計算集約的科学コードを実行する際、Xeon Phiシステムにおける主な性能ボトルネックは何か?
  • RQ3Warp shuffle、共有メモリ再設定、GPU Direct RDMAといった新規Kepler GPU機能がアプリケーション性能にどの程度向上をもたらすか?
  • RQ4大幅なアーキテクチャ再設計を伴わずに、標準CコードをXeon Phiに効率的に移植可能か?その場合の性能ペナルティはどの程度か?
  • RQ5ベクトル化が不可能な状況において、Xeon Phiの実際の性能はGTX Titanと比べて、実世界のHPCワークロードでどの程度劣るか?

主な発見

  • GTX Titanは単精度性能で4.5 TFLOPSを達成し、Tesla K20Xを15%上回り、Xeon Phi 5110Pを2.2倍上回った。
  • Xeon Phi 5110Pは、GTX 480に比べて5.5倍遅く、GTX Titanに比べて10倍遅く動作したが、理論的ピーク性能は同等であった。
  • Xeon Phiにおける性能差の主な要因は、512ビットSIMDユニットに適したベクトル化が困難であるため、QCDコードの大部分が容易にベクトル化できないことにある。
  • GPU Direct RDMA v2は、GPU-CPU間転送と同等の速度でGPU間データ転送を可能にし、従来手法に比べて遅延を2/3削減した。
  • GTX Titanは二重精度性能で1.15 GFLOPS/USDを達成し、Tesla K20X(0.35 GFLOPS/USD)およびXeon Phi 5110P(0.38 GFLOPS/USD)を大きく上回った。
  • スレッドおよびブロックの次元調整、ワープシャッフルの活用、共有メモリ/L1キャッシュの再設定比の最適化により、GTX Titanにおけるカーネル性能が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。