[논문 리뷰] HPC AI500: Representative, Repeatable and Simple HPC AI Benchmarking
이 논문은 고성능 계산(HPC) AI 시스템을 위한 대표성 있고 반복 가능하며 단순한 벤치마킹 방법론인 HPC AI500을 소개한다. 두 가지 워크로드—이미지 분류(비즈니스)와 극한 기상 분석(과학적)을 선정하고, 처리량과 목표 정확도를 통합한 Valid FLOPS라는 지표를 제안하여 시스템을 순위 매긴다. 이 벤치마크는 64개 GPU에서 혼합 정밀도 학습과 통신 압축을 적용하여 939 TFLOPS를 달성한다.
Recent years witness a trend of applying large-scale distributed deep learning algorithms (HPC AI) in both business and scientific computing areas, whose goal is to speed up the training time to achieve a state-of-the-art quality. The HPC AI benchmarks accelerate the process. Unfortunately, benchmarking HPC AI systems at scale raises serious challenges. This paper presents a representative, repeatable and simple HPC AI benchmarking methodology. Among the seventeen AI workloads of AIBench Training -- by far the most comprehensive AI Training benchmarks suite -- we choose two representative and repeatable AI workloads. The selected HPC AI benchmarks include both business and scientific computing: Image Classification and Extreme Weather Analytics. To rank HPC AI systems, we present a new metric named Valid FLOPS, emphasizing both throughput performance and a target quality. The specification, source code, datasets, and HPC AI500 ranking numbers are publicly available from \url{https://www.benchcouncil.org/HPCAI500/}.
연구 동기 및 목표
- HPC AI 워크로드를 위한 대표성 있고 반복 가능하며 단순한 벤치마킹의 부족을 해결하기 위해.
- 비즈니스 및 과학 계산 도메인을 모두 반영하는 두 가지 AI 워크로드를 식별하고 선정하기 위해.
- 처리량과 목표 모델 품질을 모두 고려하는 신규 성능 지표인 Valid FLOPS를 개발하기 위해.
- 표준화된 소스 코드, 데이터셋, 구성 정보를 통해 벤치마킹의 재현 가능성을 확보하기 위해.
- HPC AI500 벤치마크 기반으로 공개된 HPC AI 시스템 순위를 발표하기 위해.
제안 방법
- AIBench Training의 17개 워크로드 중에서 대표적인 AI 워크로드인 이미지 분류와 극한 기상 분석을 선정한다.
- 대규모 GPU 시스템에서 성능을 최적화하기 위해 혼합 정밀도 학습과 통신 압축을 적용한다.
- 시간-품질을 반영하기 위해 FLOPS와 모델 정확도를 통합한 Valid FLOPS를 신규 지표로 도입한다.
- 공개된 소스 코드, 데이터셋, 시스템 구성 정보를 통해 벤치마킹을 표준화한다.
- 재현 가능성을 확보하기 위해 모델 특성, 마이크로 아키텍처, 난수 요소에 대한 체계적 분 析를 수행한다.
- 1에서 64개 GPU까지의 확장성 검증을 통해 병렬 효율성과 통신 오버헤드를 측정한다.
실험 결과
연구 질문
- RQ1비즈니스 및 과학 계산 도메인을 모두 반영하면서도 재현 가능성과 단순성을 확보할 수 있는 HPC AI 워크로드는 무엇인가?
- RQ2분산 딥 러닝 환경에서 계산 처리량과 모델 품질(정확도)을 모두 반영할 수 있는 벤치마크 지표는 어떻게 설계할 수 있는가?
- RQ3대규모 HPC AI 학습에서 핵심 성능 저하 요인(계산 vs. 통신)은 무엇이며, 워크로드 간에 어떻게 다를 수 있는가?
- RQ4혼합 정밀도 학습과 통신 압축은 대규모 GPU 클러스터에서 성능과 확장성에 어떤 영향을 미치는가?
- RQ5시스템 스케일링이 분산 HPC AI 워크로드에서 모델 정확도와 학습 효율성에 어떤 영향을 미치는가?
주요 결과
- 이미지 분류 벤치마크는 64개 GPU에서 혼합 정밀도 최적화와 통신 압축을 적용하여 939 TFLOPS를 달성했다.
- 극한 기상 분석(EWA) 워크로드는 통신 압축을 적용하여 109 TFLOPS를 기록했으며, 확장성에 따라 뚜렷한 성능 향상을 보였다.
- EWA는 이미지 분류보다 통신 대역폭 소비가著명하게 높아, EWA가 통신 집약적이고 이미지 분류가 계산 집약적임을 확인했다.
- 저속도 이더넷 환경에서 64개 GPU에서 병렬 효율성이 EWA의 경우 0.36, 이미지 분류의 경우 0.37로 떨어졌으며, 이는 통신 병목 현상 때문이었다.
- 이미지 분류의 FP32 버전은 64개 GPU에서 345에서 414 TFLOPS로 성능 향상을 보였고, 혼합 정밀도 버전은 718에서 939 TFLOPS로 향상되었다.
- Fujitsu는 HPC AI500 순위에서 31.41 VPFLOPS를 기록하여 가장 높은 Valid FLOPS 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.