[논문 리뷰] Performance of Kepler GTX Titan GPUs and Xeon Phi System
이 논문은 고성능 계산에서 NVIDIA의 GeForce GTX Titan과 Intel의 Xeon Phi 공처리기의 성능을 평가한다. 특히 격자 QCD 시뮬레이션에서, GTX Titan은 Tesla K20X 대비 1/3 가격에 단정밀도 성능 4.5 TFLOPS를 제공하지만, Xeon Phi는 낮은 벡터화 지원과 비효율적인 메모리 접근으로 인해 성능이 10배 낮아져 이러한 워크로드에 적합하지 않다. 이는 이론적 우수성에도 불구하고 그렇다.
NVIDIA's new architecture, Kepler improves GPU's performance significantly with the new streaming multiprocessor SMX. Along with the performance, NVIDIA has also introduced many new technologies such as direct parallelism, hyper-Q and GPU Direct with RDMA. Apart from other usual GPUs, NVIDIA also released another Kepler 'GeForce' GPU named GTX Titan. GeForce GTX Titan is not only good for gaming but also good for high performance computing with CUDA. Nevertheless, it is remarkably cheaper than Kepler Tesla GPUs. We investigate the performance of GTX Titan and find out how to optimize a CUDA code appropriately for it. Meanwhile, Intel has launched its new many integrated core (MIC) system, Xeon Phi. A Xeon Phi coprocessor could provide similar performance with NVIDIA Kepler GPUs theoretically but, in reality, it turns out that its performance is significantly inferior to GTX Titan.
연구 동기 및 목표
- 소비자용 GPU인 GeForce GTX Titan의 고성능 계산 워크로드에서의 성능 평가.
- 격자 QCD 시뮬레이션에서 GTX Titan의 성능을 Intel Xeon Phi 및 Tesla K20X와 비교.
- Kepler 기반 GPU에서 CUDA 커널 최적화 전략 규명.
- 특히 벡터화 및 메모리 접근 측면에서 Xeon Phi 시스템의 실질적 한계 분석.
- GPU Direct RDMA 및 직접 병렬 처리와 같은 신규 GPU 기술의 실제 성능 평가.
제안 방법
- GTX 480, GTX Titan, Xeon Phi 5110P에서 공액 그래디언트(CG) 솔버 성능을 벤치마크.
- 각 장치에서 10회 실행한 CG 실행 시간(초)을 측정하여 성능 측정.
- 스레드/블록 구성 조정 및 공유 메모리/L1 캐시 재구성과 같은 CUDA 커널 최적화 적용.
- GPU 간 데이터 전송을 위한 GPU Direct RDMA v2의 성능 평가를 표준 cudaMemcpy와 비교.
- Intel 컴파일러로 코드 컴파일하여 Xeon Phi에서의 벡터화 과제 평가 및 성능 영향 측정.
- 피크 FLOPS 계산과 실제 벤치마크를 활용해 이론적 성능 대비 실제 성능 분석.
실험 결과
연구 질문
- RQ1격자 QCD 시뮬레이션에서 이중정밀도 부동소수점 연산에서 GTX Titan의 성능은 Tesla K20X 및 Xeon Phi와 어떻게 비교되는가?
- RQ2계산 집약적인 과학적 코드를 실행할 때 Xeon Phi 시스템에서 주요 성능 저하 요인은 무엇인가?
- RQ3워프 셔플, 공유 메모리 재구성, GPU Direct RDMA와 같은 신규 Kepler GPU 기능이 응용 프로그램 성능에 얼마나 기여하는가?
- RQ4표준 C 코드는 중대한 아키텍처 재설계 없이 Xeon Phi로 효율적으로 이식 가능한가? 이로 인해 발생하는 성능 손실은 어느 정도인가?
- RQ5벡터화가 불가능한 경우, 실제 HPC 워크로드에서 Xeon Phi의 실제 성능은 GTX Titan에 비해 어떻게 비교되는가?
주요 결과
- GTX Titan은 단정밀도 성능에서 4.5 TFLOPS를 달성하여 Tesla K20X보다 15% 뛰어나고, Xeon Phi 5110P보다 2.2배 빠르다.
- Xeon Phi 5110P는 GTX 480에 비해 5.5배 느리고, GTX Titan에 비해 10배 느리게 작동한다. 이는 이론적 피크 성능가까이 비슷하지만 그렇다.
- Xeon Phi에서의 성능 격차는 대부분의 QCD 코드가 512비트 SIMD 유닛에 쉽게 벡터화되지 않기 때문에 비효율적인 벡터화에서 기인한다.
- GPU Direct RDMA v2는 GPU-CPU 전송 수준의 속도로 GPU 간 데이터 전송을 가능하게 하여 이전 방법 대비 지연을 2/3 감소시킨다.
- GTX Titan은 이중정밀도 성능에서 1.15 GFLOPS/USD를 제공하며, Tesla K20X(0.35 GFLOPS/USD) 및 Xeon Phi 5110P(0.38 GFLOPS/USD)를 크게 앞선다.
- 스레드 및 블록 크기 조정, 워프 셔플 활용, 공유 메모리/L1 캐시 비율 재구성 등의 최적화는 GTX Titan에서 커널 성능을 크게 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.