Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Reuse, Performance, and Hardware Cost of DNN Dataflows: A Data-Centric Approach Using MAESTRO

Hyoukjun Kwon, Prasanth Chatarasi|arXiv (Cornell University)|2018. 05. 04.
Parallel Computing and Optimization Techniques참고 문헌 48인용 수 16
한 줄 요약

이 논문은 컴파일러 友好的 지시어를 통해 데이터플로우 사양을 인코딩함으로써 재사용, 성능 및 하드웨어 비용을 정량화하는 데이터 중심 분석 모델 MAESTRO를 소개한다. 이 모델은 480M개의 구성에 걸쳐 빠르고 정확한 설계공간 탐색을 가능하게 하며, 1초당 0.17M개의 설계를 처리하면서 풍부한 성능 및 에너지 효율성을 확보한 파레토 최적 설계를 식별한다. 또한 최적의 DNN 가속기 성능을 위해 균형 잡힌 하드웨어 자원 할당에 대한 핵심 통찰을 제공한다.

ABSTRACT

The data partitioning and scheduling strategies used by DNN accelerators to leverage reuse and perform staging are known as dataflow, and they directly impact the performance and energy efficiency of DNN accelerator designs. An accelerator microarchitecture dictates the dataflow(s) that can be employed to execute a layer or network. Selecting an optimal dataflow for a layer shape can have a large impact on utilization and energy efficiency, but there is a lack of understanding on the choices and consequences of dataflows, and of tools and methodologies to help architects explore the co-optimization design space. In this work, we first introduce a set of data-centric directives to concisely specify the space of DNN dataflows in a compilerfriendly form. We then show how these directives can be analyzed to infer various forms of reuse and to exploit them using hardware capabilities. We codify this analysis into an analytical cost model, MAESTRO (Modeling Accelerator Efficiency via Spatio-Temporal Reuse and Occupancy), that estimates various cost-benefit tradeoffs of a dataflow including execution time and energy efficiency for a DNN model and hardware configuration. We demonstrate the use of MAESTRO to drive a hardware design space exploration (DSE) experiment, which searches across 480M designs to identify 2.5M valid designs at an average rate of 0.17M designs per second, including Pareto-optimal throughput- and energy-optimized design points.

연구 동기 및 목표

  • DNN 데이터플로우 선택 사항과 그 성능 및 에너지 효율성에 대한 영향에 대한 체계적이고 정량적인 이해 부족을 해결하기 위해.
  • 재사용 및 스케줄링 전략을 포괄하는 컴파일러 친화적, 데이터 중심 표기법을 제공하기 위해.
  • 다양한 데이터플로우 및 하드웨어 구성에서 실행 시간, 에너지 효율성 및 하드웨어 비용을 추정하는 분석 비용 모델(MAESTRO)을 개발하기 위해.
  • 초기 유효 설계를 제거함으로써 확장 가능하고 고속의 설계공간 탐색(DSE)을 가능하게 하기 위해.
  • PE 수, 버퍼 크기 및 NoC 대역폭의 상호 교환 관계를 드러내어 마이크로아키텍처와 데이터플로우의 공동 최적화를 이끌기 위해.

제안 방법

  • 재사용 및 스케줄링 전략을 포괄하는 컴파일러 친화적 형식으로 DNN 데이터플로우를 간결하게 표현하기 위한 데이터 중심 지시어 세트를 도입한다.
  • 이 지시어들을 분석하여 PEs 및 온칩 버퍼에서의 영역적 및 시간적 재사용 패턴을 유추한다.
  • PE 수, 버퍼 크기 및 NoC 대역폭 등의 매개변수를 사용하여 실행 시간, 에너지 효율성 및 하드웨어 비용을 추정하는 분석 비용 모델 MAESTRO를 개발한다.
  • L1, L2 및 NoC 간의 데이터 이동을 고려하고 타일 크기 및 네트워크 토폴로지에 기인한 지연을 포함하여 통신 오버헤드를 모델링한다.
  • 초기 유효하지 않은 설계를 제거하는 DSE 프레임워크에 모델을 통합함으로써 1초당 0.17M개의 설계를 처리하는 고속 탐색을 가능하게 한다.
  • MAESTRO의 정확성을 사이클 정밀 시뮬레이션 및 Eyeriss와 MAERI에서 보고된 실행 시간과 비교하여 검증하였으며, 높은 일致성을 보였다.

실험 결과

연구 질문

  • RQ1재사용 및 스케줄링 전략을 포괄하는 데이터 중심 지시어를 통해 DNN 데이터플로우를 공식적이고 압축적으로 명세화할 수 있는 방법은 무엇인가?
  • RQ2주어진 DNN 모델과 하드웨어에서 다양한 데이터플로우 구성 간의 주요 성능 및 에너지 효율성 트레이드오프는 무엇인가?
  • RQ3PE 수, 버퍼 크기 및 NoC 대역폭의 변동이 DNN 가속기의 스루풋 및 에너지 효율성에 미치는 영향은 무엇인가?
  • RQ4사이클 정밀 시뮬레이션 없이도 분석 모델이 성능 및 비용을 정확하게 예측할 수 있는가?
  • RQ5다양한 DNN 레이어에 최적의 하드웨어 구성은 무엇이며, 이는 초기 레이어와 후기 레이어 간에 어떻게 다를 수 있는가?

주요 결과

  • MAESTRO는 실행 시간 및 에너지 효율성 예측에서 높은 정확도를 보이며, 사이클 정밀 시뮬레이션 및 Eyeriss와 MAERI에서 보고된 실행 시간과 높은 일致성을 보였다.
  • MAESTRO 기반 DSE 프레임워크는 480M개의 설계를 탐색하고 평균적으로 1초당 0.17M개의 유효 설계를 식별함으로써 확장 가능한 탐색을 가능하게 하였다.
  • 스루풋 최적화 설계는 PE, 버퍼 및 NoC 간에 균형 잡힌 자원 할당이 필요하며, 단지 버퍼 크기의 증가만으로는 성능이나 에너지 효율성을 향상시키지 못한다.
  • 높은 공간 다중방송 또는 감소 지원 기능을 가진 데이터플로우는 최대 47% 높은 에너지 소비를 유발함으로써 상당한 비용 트레이드오프를 나타낸다.
  • DNN의 초기 레이어와 후기 레이어는 뚜렷한 하드웨어 선호도 차이를 보이며, 이는 적응형 및 이질적 가속기 설계의 필요성을 암시한다.
  • 모델은 최적의 성능을 위해서는 PE, 버퍼 및 NoC의 공동 최적화가 필요하며, 자원 할당이 반드시 한 구성 요소에 의해 지배되는 것이 아니라 균형을 이루어야 한다는 점을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.