Skip to main content
QUICK REVIEW

[论文解读] Performance of Kepler GTX Titan GPUs and Xeon Phi System

Hwancheol Jeong, Weonjong Lee|arXiv (Cornell University)|Nov 4, 2013
Parallel Computing and Optimization Techniques参考文献 2被引用 4
一句话总结

本文评估了NVIDIA GeForce GTX Titan和Intel Xeon Phi协处理器在高性能计算中的性能表现,特别是在格点QCD模拟中的应用。结果表明,尽管GTX Titan在价格仅为Tesla K20X的1/3时即可实现4.5 TFLOPS的单精度性能,但Xeon Phi由于向量化支持不佳和内存访问效率低下,性能表现差10倍,因此尽管具备理论优势,仍不适合此类工作负载。

ABSTRACT

NVIDIA's new architecture, Kepler improves GPU's performance significantly with the new streaming multiprocessor SMX. Along with the performance, NVIDIA has also introduced many new technologies such as direct parallelism, hyper-Q and GPU Direct with RDMA. Apart from other usual GPUs, NVIDIA also released another Kepler 'GeForce' GPU named GTX Titan. GeForce GTX Titan is not only good for gaming but also good for high performance computing with CUDA. Nevertheless, it is remarkably cheaper than Kepler Tesla GPUs. We investigate the performance of GTX Titan and find out how to optimize a CUDA code appropriately for it. Meanwhile, Intel has launched its new many integrated core (MIC) system, Xeon Phi. A Xeon Phi coprocessor could provide similar performance with NVIDIA Kepler GPUs theoretically but, in reality, it turns out that its performance is significantly inferior to GTX Titan.

研究动机与目标

  • 评估消费级GPU GeForce GTX Titan在高性能计算工作负载中的性能表现。
  • 在格点QCD模拟中,将GTX Titan的性能与Intel Xeon Phi及Tesla K20X进行对比。
  • 识别针对基于Kepler架构GPU的CUDA内核优化策略。
  • 分析Xeon Phi系统在向量化和内存访问方面的实际限制。
  • 评估新型GPU技术(如GPU Direct RDMA和直接并行性)在实际应用中的性能表现。

提出的方法

  • 在GTX 480、GTX Titan和Xeon Phi 5110P上基准测试共轭梯度(CG)求解器的性能。
  • 通过在每台设备上运行10次CG求解,测量其耗时(单位:秒)。
  • 应用CUDA内核优化,包括线程/块配置调优以及共享内存/L1缓存重配置。
  • 评估GPU Direct RDMA v2在GPU间数据传输中的性能,与标准cudaMemcpy方法进行对比。
  • 通过使用Intel编译器编译代码并测量性能影响,评估Xeon Phi上的向量化挑战。
  • 通过峰值FLOPS计算与实际基准测试对比,分析理论性能与实际性能的差异。

实验结果

研究问题

  • RQ1在格点QCD模拟中,GTX Titan在双精度浮点运算方面的性能与Tesla K20X和Xeon Phi相比如何?
  • RQ2在运行计算密集型科学代码时,Xeon Phi系统的主要性能瓶颈是什么?
  • RQ3Kepler架构GPU的新特性(如warp shuffle、共享内存重配置和GPU Direct RDMA)在多大程度上提升了应用程序性能?
  • RQ4标准C代码能否在无需重大重构的情况下高效移植到Xeon Phi上?这种移植会带来多大的性能损失?
  • RQ5在实际HPC工作负载中,当向量化不可行时,Xeon Phi的实际性能与GTX Titan相比如何?

主要发现

  • GTX Titan在单精度性能上达到4.5 TFLOPS,比Tesla K20X快15%,比Xeon Phi 5110P快2.2倍。
  • Xeon Phi 5110P运行CG求解器的速度比GTX 480慢5.5倍,比GTX Titan慢10倍,尽管其理论峰值性能相近。
  • Xeon Phi性能差距主要源于向量化效率低下,因为大部分QCD代码难以为512位SIMD单元高效向量化。
  • GPU Direct RDMA v2实现了与GPU-CPU传输相当的GPU间数据传输速度,相比之前方法将延迟降低了2/3。
  • GTX Titan在双精度性能上实现1.15 GFLOPS/美元,显著优于Tesla K20X(0.35 GFLOPS/美元)和Xeon Phi 5110P(0.38 GFLOPS/美元)。
  • 通过调整线程和块尺寸、利用warp shuffle以及重新配置共享内存/L1缓存比例等优化手段,显著提升了GTX Titan上内核的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。