Skip to main content
QUICK REVIEW

[논문 리뷰] ZigZag: A Memory-Centric Rapid DNN Accelerator Design Space Exploration Framework

Linyan Mei, Pouya Houshmand|arXiv (Cornell University)|2020. 07. 22.
Parallel Computing and Optimization Techniques참고 문헌 22인용 수 14
한 줄 요약

ZigZag는 유연한 메모리 계층을 통해 짝수 및 홀수 시간 매핑을 모두 탐색할 수 있는 메모리 중심의 빠른 DNN 가속기 설계공간 탐색(DSE) 프레임워크이다. 메모리 중심의 중첩 루프 표현과 지연 시간 향상 분석 비용 모델을 사용함으로써, 특히 공간적 편향이 효율성에 큰 영향을 미치는 공유되지 않는 메모리 계층에서 이전 프레임워크보다 최대 33% 더 에너지 효율적인 설계를 식별한다.

ABSTRACT

Building efficient embedded deep learning systems requires a tight co-design between DNN algorithms, memory hierarchy, and dataflow. However, owing to the large degrees of freedom in the design space, finding an optimal solution through the implementation of individual design points becomes infeasible. Recently, several estimation frameworks for fast design space exploration (DSE) have emerged, yet they either suffer from long runtimes or a limited exploration space. This work introduces ZigZag, a memory-centric rapid DNN accelerator DSE framework which extends the DSE with uneven mapping opportunities, in which operands at shared memory levels are no longer bound to use the same memory levels for each loop index. For this, ZigZag uses a memory-centric nested-for-loop format as a uniform representation to integrate algorithm, accelerator, and algorithm-to-accelerator mapping, and consists of three key components: 1) a latency-enhanced analytical Hardware Cost Estimator, 2) a Temporal Mapping Generator that supports even/uneven scheduling on any type of memory hierarchy, and 3) an Architecture Generator that explores the whole memory hierarchy design space. Benchmarking experiments against existing frameworks, together with three case studies at different design abstraction levels show the strength of ZigZag. Up to 33% more energy-efficient solutions are found by introducing ZigZag's uneven scheduling opportunities.

연구 동기 및 목표

  • 임베디드 시스템의 전력 및 면적 제약 조건 하에서 광범위한 DNN 가속기 설계공간을 효율적으로 탐색하는 데 도전하는 것.
  • 기존 DSE 프레임워크가 짝수 매핑 또는 공유 메모리 계층에만 제한되는 한계를 극복하는 것.
  • 알고리즘-하드웨어 매핑, 메모리 계층, 데이터플로우 스케줄링을 동시에 최적화하여 파레토 최적의 가속기 설계를 발견할 수 있도록 하는 것.
  • 다양한 메모리 구성에서 짝수 및 홀수 스케줄링을 모두 지원하는 빠르고 분석적이며 정확한 비용 추정 방법을 제공하는 것.
  • 공간적 편향과 메모리 계층 설계가 에너지 효율성에 미치는 영향이 특히 운영자 간 메모리 수준이 공유되지 않을 경우에 크게 영향을 미친다는 것을 입증하는 것.

제안 방법

  • ZigZag는 알고리즘, 가속기, 매핑 설계공간을 통합하기 위해 메모리 중심의 중첩 for-루프 표현을 사용한다.
  • 루프 관련성 원칙을 기반으로 한 하드웨어 비용 추정기(Hardware Cost Estimator)를 활용하여 낮은 오버헤드로 에너지 소비와 처리량을 분석적으로 계산한다.
  • 시간 매핑 생성기(Temporal Mapping Generator)는 짝수 및 홀수 루프 블로킹 기법을 모두 지원하여 어떤 메모리 계층에서도 유연한 스케줄링을 가능하게 한다.
  • 아키텍처 생성기(Architecture Generator)는 균형 잡힌/균형 잡히지 않은, 공유/독립적인 구성을 포함한 전체 유효한 메모리 계층 공간을 탐색한다.
  • 이 구성 요소들을 통합한 유일한 DSE 파이프라인을 통해 고차원 설계공간의 빠르고 분석적인 탐색을 가능하게 한다.
  • 고정형 및 완전히 유연한 하드웨어 템플릿을 모두 지원하여 고수준 제약 조건에서부터 세부적인 메모리 구성에 이르기까지 탐색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1DSE 프레임워크가 짝수 및 홀수 시간 매핑을 모두 지원하면서도 빠르고 정확하게 DNN 가속기 설계공간을 탐색할 수 있는가?
  • RQ2운영자 간 메모리 수준이 공유되지 않을 경우, 공간적 편향이 에너지 효율성에 미치는 영향은 어떻게 변화하는가?
  • RQ3홀수 스케줄링이 짝수 스케줄링에 비해 설계공간을 얼마나 넓히며, 더 에너지 효율적인 솔루션을 도출할 수 있는가?
  • RQ4작업에 맞는 메모리 계층을 가능하게 하기 위해 구성 가능한 메모리 바이패스 및 운영자 재할당 기능을 갖춘 네트워크온칩은 면적과 전력 오버헤드를 감당할 가치가 있는가?
  • RQ5PE 어레이가 완전히 매핑된 경우 공간적 편향이 에너지 소비에 미치는 영향이 작다는 가정이 모든 메모리 계층 설계에서 성립하는가?

주요 결과

  • ZigZag는 특히 공유되지 않는 메모리 계층에서 홀수 스케줄링을 가능하게 함으로써 기존 프레임워크보다 최대 33% 더 에너지 효율적인 설계를 발견한다.
  • 메모리 수준이 운영자 간에 공유되지 않을 경우, 공간적 편향이 에너지 효율성에 미치는 영향은 최대 5배까지 증가하여 이전의 가정을 뒤집는다.
  • 공유 메모리 계층에서는 시간 매핑이 공간적 편향으로 인한 불균형한 데이터 재사용을 상쇄시켜 에너지 소비에 미치는 영향을 줄일 수 있다.
  • 공유되지 않는 메모리 계층에서는 공간적 편향의 선택이 스케줄링 유연성의 감소로 이어져 에너지 효율성에 큰 영향을 미친다.
  • MobileNetV2와 같은 워크로드는 맞춤형 메모리 계층을 통해 큰 이점을 얻으며, 구성 가능한 메모리 바이패스 기능을 갖춘 네트워크온칩은 추론 비용을 최대 30%까지 감소시킬 수 있다.
  • 프레임워크의 분석적 비용 모델은 최소한의 런타임 오버헤드로 높은 정확도를 달성하여 레이어당 수백 개의 설계 포인트를 빠르게 탐색할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.