Skip to main content
QUICK REVIEW

[논문 리뷰] HPC AI500: The Methodology, Tools, Roofline Performance Models, and Metrics for Benchmarking HPC AI Systems

Zihan Jiang, Lei Wang|arXiv (Cornell University)|2020. 07. 01.
Advanced Data Storage Technologies참고 문헌 65인용 수 13
한 줄 요약

이 논문은 고성능 계산(HPC) AI 시스템을 위한 종합적인 벤치마킹 방법론인 HPC AI500 V2를 소개한다. 이는 동등성, 대표성, 경제성, 재현 가능성을 보장한다. AIBench 기반으로 실제 응용 사례인 이미지 분류 및 극한 기상 분석 두 가지 벤치마크를 제안하며, 성능 상한선을 제공하는 Roofline 성능 모델과 함께 Valid FLOPS 및 Valid FLOPS per watt와 같은 신규 메트릭을 도입하여 성능과 에너지 효율성을 객관적으로 평가한다.

ABSTRACT

The recent years witness a trend of applying large-scale distributed deep learning in both business and scientific computing areas, whose goal is to speed up the training time to achieve a state-of-the-art quality. The HPC community feels a great interest in building the HPC AI systems that are dedicated to running those workloads. The HPC AI benchmarks accelerate the process. Unfortunately, benchmarking HPC AI systems at scale raises serious challenges. None of previous HPC AI benchmarks achieve the goal of being equivalent, relevant, representative, affordable, and repeatable. This paper presents a comprehensive methodology, tools, Roofline performance models, and innovative metrics for benchmarking, optimizing, and ranking HPC AI systems, which we call HPC AI500 V2.0. We abstract the HPC AI system into nine independent layers, and present explicit benchmarking rules and procedures to assure equivalence of each layer, repeatability, and replicability. On the basis of AIBench -- by far the most comprehensive AI benchmarks suite, we present and build two HPC AI benchmarks from both business and scientific computing: Image Classification, and Extreme Weather Analytics, achieving both representativeness and affordability. To rank the performance and energy-efficiency of HPC AI systems, we propose Valid FLOPS, and Valid FLOPS per watt, which impose a penalty on failing to achieve the target quality. We propose using convolution and GEMM -- the two most intensively-used kernel functions to measure the upper bound performance of the HPC AI systems, and present HPC AI roofline models for guiding performance optimizations. The evaluations show our methodology, benchmarks, performance models, and metrics can measure, optimize, and rank the HPC AI systems in a scalable, simple, and affordable way. HPC AI500 V2.0 are publicly available from http://www.benchcouncil.org/benchhub/hpc-ai500-benchmark.

연구 동기 및 목표

  • 다양한 하드웨어 및 소프트웨어 스택 간에 공정하게 성능을 비교할 수 있는 동등성, 재현 가능성, 대표성을 확보하는 벤치마크의 부족을 해소하기 위해.
  • MLPerf, HPL-AI, Deep500, AAH와 같은 기존 벤치마크들이 동등성, 재현 가능성 또는 실제 작업 워크로드의 대표성을 확보하지 못하는 한계를 극복하기 위해.
  • HPC AI 시스템을 9개의 독립된 계층으로 추상화하여 제어된 계층별 벤치마킹이 가능하도록 하며, 동등성과 재현 가능성에 대한 엄격한 규칙을 적용하기 위해.
  • 실제 비즈니스 및 과학적 AI 워크로드에서 유래한 저비용, 대표성 있고 확장 가능한 벤치마크를 개발하기 위해 — 이미지 분류(이미지넷/레스넷-50 기반) 및 극한 기상 분석.
  • 목표 모델 정확도를 달성하지 못하는 시스템을 제재하는 메트릭인 Valid FLOPS 및 Valid FLOPS per watt를 도입하여 성능 및 에너지 효율성에 대한 공정한 순위 매기기를 보장하기 위해.

제안 방법

  • HPC AI 시스템을 하드웨어, 소프트웨어 스택, 통신 등과 같은 9개의 독립 계층으로 추상화하여, 다른 요소는 고정한 상태에서 각 계층을 독립적으로 테스트함으로써 동등성과 재현 가능성을 확보한다.
  • 각 계층에 대해 병렬 처리, 통신, 정밀도 설정 등의 엄격한 벤치마킹 규칙과 절차를 정의하여 다양한 시스템 간 일관된 구현을 보장한다.
  • 이미지넷/레스넷-50 기반의 이미지 분류 및 실제 과학적 데이터셋을 사용한 극한 기상 분석을 포함하는 두 가지 종합적인 스택 벤치마크를 구축한다. 이는 포괄적인 AIBench 스위트에서 유래한다.
  • 컨volution 및 GEMM 커널을 기반으로 한 성능 상한선을 제공하는 HPC AI Roofline 모델을 개발하여 체계적인 성능 분석 및 최적화 가이드라인을 제공한다.
  • 목표 정확도에 도달하지 못하는 시스템을 제재하는 Valid FLOPS 및 Valid FLOPS per watt 메트릭을 도입하여 성능 순위가 속도뿐 아니라 정확도 준수 여부도 반영하도록 보장한다.
  • BenchCouncil의 공개 리포지터리를 통해 사양, 소스 코드, 데이터셋, 벤치마킹 데이터를 오픈소스로 배포하여 투명성, 재현 가능성, 커뮤니티 수용을 보장한다.

실험 결과

연구 질문

  • RQ1다양한 하드웨어 및 소프트웨어 구성 간에 동등성, 재현 가능성, 재현 가능성을 확보할 수 있는 HPC AI 시스템의 벤치마킹 방법은 무엇인가?
  • RQ2비즈니스 및 과학 계산 분야에서 HPC AI 시스템의 성능 특성을 가장 잘 반영하는 실제 워크로드는 무엇인가?
  • RQ3시스템의 목표 모델 정확도 달성 능력이 상이할 경우, 성능과 에너지 효율성을 어떻게 공정하게 순위 매길 수 있는가?
  • RQ4기본 커널(컨volution 및 GEMM) 기반의 Roofline 모델이 HPC AI 워크로드의 시스템 수준 최적화를 어떻게 안내하는가?
  • RQ5HPC AI 시스템에 대해 높은 대표성과 기술적 엄격함을 유지하면서도 확장성과 저비용을 동시에 확보할 수 있는 벤치마킹 방법론이 가능한가?

주요 결과

  • HPC AI500 V2 방법론은 표준화된 테스트 규칙을 적용한 9개의 독립 계층으로 시스템을 추상화함으로써 동등성, 재현 가능성, 재현 가능성을 성공적으로 달성했다.
  • 이미지 분류 및 극한 기상 분석 두 벤치마크는 실제 데이터셋과 프로덕션 수준의 모델을 사용하여 강력한 대표성과 저비용을 입증했다.
  • Valid FLOPS 및 Valid FLOPS per watt 메트릭의 도입으로 목표 정확도에 도달하지 못하는 시스템을 제재함으로써 성능 및 에너지 효율성 순위 매기기가 공정해졌다.
  • 컨volution 및 GEMM 커널 기반의 HPC AI Roofline 모델은 성능 저하 요인을 효과적으로 식별하고 HPC AI 시스템의 최적화 전략을 안내하는 데 기여했다.
  • 평가 결과, 방법론, 벤치마크, 모델, 메트릭 모두가 확장 가능하고 단순하며 저비용임을 확인하여 다양한 HPC AI 플랫폼 간 일관된 시스템 평가가 가능함을 입증했다.
  • 모든 사양, 소스 코드, 데이터셋, 벤치마킹 데이터는 http://www.benchcouncil.org/benchhub/hpc-ai500-benchmark 에 공개되어 있어 투명성과 커뮤니티 전반의 수용을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.