Skip to main content
QUICK REVIEW

[논문 리뷰] A Full-stack Accelerator Search Technique for Vision Applications.

Dan Zhang, Safeen Huda|arXiv (Cornell University)|2021. 05. 26.
Advanced Neural Network Applications참고 문헌 51인용 수 4
한 줄 요약

이 논문은 시각 워크로드를 위한 데이터패스, 스케줄링, 컴파일러 변환(예: 연산 융합, 텐서 팯딩)을 공동으로 최적화하는 포괄적인 하드웨are-소프트웨어 공동 설계 프레임워크인 FAST를 제안한다. EfficientNet, ResNet50v2 및 OCR에서 평가한 결과, 단일 모델 최적화 시 TPU-v3 대비 최대 6.1배 높은 Perf/TDP를 달성하였으며, 워크로드 서브셋 전반에 걸쳐 평균 2.85배 향상되었고, 하나의 설계로도 여러 모델에서 평균 2.35배의 성능 향상을 이룩하였다.

ABSTRACT

The rapidly-changing ML model landscape presents a unique opportunity for building hardware accelerators optimized for specific datacenter-scale workloads. We propose Full-stack Accelerator Search Technique (FAST), a hardware accelerator search framework that defines a broad optimization environment covering key design decisions within the hardware-software stack, including hardware datapath, software scheduling, and compiler passes such as operation fusion and tensor padding. Although FAST can be used on any number and type of deep learning workload, in this paper we focus on optimizing for a single or small set of vision models, resulting in significantly faster and more power-efficient designs relative to a general purpose ML accelerator. When evaluated on EfficientNet, ResNet50v2, and OCR inference performance relative to a TPU-v3, designs generated by FAST optimized for single workloads can improve Perf/TDP (peak power) by over 6x in the best case and 4x on average. On a limited workload subset, FAST improves Perf/TDP 2.85x on average, with a reduction to 2.35x for a single design optimized over the set of workloads. In addition, we demonstrate a potential 1.8x speedup opportunity for TPU-v3 with improved scheduling.

연구 동기 및 목표

  • 데이터센터 규모의 시각 워크로드에 맞는 특화된 가속기의 증가하는 수요를 해결하기 위해.
  • 시각 모델에 대해 성능과 에너지 효율성 측면에서 일반 목적의 머신러닝 가속기의 한계를 극복하기 위해.
  • 하드웨어 데이터패스, 소프트웨어 스케줄링, 컴파일러 변환에 이르기까지 광범위한 최적화 영역을 탐색하기 위해.
  • 시각 추론을 위한 포괄적 공동 설계를 통해 뚜렷한 성능 및 에너지 효율성 향상을 입증하기 위해.
  • 기존 가속기인 TPU-v3에 대한 개선된 스케줄링의 영향을 검증하기 위해.

제안 방법

  • FAST는 하드웨어 데이터패스 설계, 소프트웨어 수준의 스케줄링, 연산 융합 및 텐서 패딩과 같은 컴파일러 최적화를 포함하는 포괄적인 검색 공간을 정의한다.
  • 프레임워크는 하드웨어 및 소프트웨어 구성 요소 간의 공동 설계 공간을 자동 탐색하여 최적의 구성 설정을 식별한다.
  • 성능 및 전력 모델을 사용하여 높은 Perf/TDP(워트당 성능)를 갖춘 가속기 설계로의 탐색을 이끈다.
  • 워크로드 특화 목표에 따라 단일 또는 소수의 시각 모델(예: EfficientNet 및 ResNet50v2)에 집중하는 설계 탐색을 수행한다.
  • 실제 데이터센터 제약 조건 하에서 추론 지연 및 에너지 효율성 등 다양한 메트릭을 기반으로 설계를 평가한다.
  • 기존 가속기인 TPU-v3조차도 단순히 개선된 스케줄링만으로도 최대 1.8배의 성능 향상을 달성할 수 있음을 입증한다.

실험 결과

연구 질문

  • RQ1포괄적 공동 설계 접근 방식이 시각 추론 워크로드의 성능 및 에너지 효율성에 뚜렷한 향상을 이끌 수 있는가?
  • RQ2하드웨어 데이터패스, 스케줄링, 컴파일러 단계 최적화를 공동으로 최적화함으로써 얼마나 많은 성능 향상을 기대할 수 있는가?
  • RQ3워크로드 특화 최적화와 일반 목적의 가속기 설계 간의 영향은 어떠한가?
  • RQ4개선된 스케줄링만으로도 기존 가속기인 TPU-v3에서 측정 가능한 성능 향상을 이룰 수 있는가?
  • RQ5단일 최적화 설계의 성능가 여러 시각 워크로드 간에 어떻게 비교되는가?

주요 결과

  • 단일 모델 최적화 시, FAST가 생성한 설계는 TPU-v3 대비 최대 6.1배 높은 Perf/TDP를 달성하였으며, 테스트된 모델들 평균으로 4배 향상되었다.
  • 제한된 워크로드 서브셋에서 FAST는 Perf/TDP 평균 2.85배 향상되었고, 하나의 설계로도 해당 서브셋의 모든 워크로드에서 평균 2.35배의 성능 향상을 달성하였다.
  • 프레임워크는 컴파일러 수준 최적화, 예를 들어 연산 융합 및 텐서 패딩이 성능 향상에 기여하는 데 중요한 역할을 함을 입증하였다.
  • 고정된 하드웨어 조건에서도 개선된 스케줄링만으로도 TPU-v3에서 시각 워크로드에 대해 최대 1.8배의 성능 향상을 달성할 수 있었다.
  • 결과적으로 포괄적 공동 설계가 최고 성능 및 에너지 효율성 측면에서 일반 목적의 가속기 설계보다 뛰어남을 확인하였다.
  • 가장 뛰어난 성능을 보인 FAST 최적화 설계는 뛰어난 워트당 성능을 확보하여 에너지 효율성 향상이 뚜렷하게 이루어졌음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.