Skip to main content
QUICK REVIEW

[논문 리뷰] Stream: Design Space Exploration of Layer-Fused DNNs on Heterogeneous Dataflow Accelerators

Arne Symons, Linyan Mei|arXiv (Cornell University)|2022. 12. 20.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 이질적 다중코어 가속기에서 계층 융합 DNN의 설계 공간 탐색을 위한 오픈소스 프레임워크인 Stream을 소개한다. 다양한 하드웨어 아키텍처에 걸쳐 세밀한, 깊이 우선 스케줄링을 가능하게 하여 기존 계층별 스케줄링 대비 에너지-지연 제품(Energy-Delay Product)을 최대 30배까지 감소시킨다.

ABSTRACT

As the landscape of deep neural networks evolves, heterogeneous dataflow accelerators, in the form of multi-core architectures or chiplet-based designs, promise more flexibility and higher inference performance through scalability. So far, these systems exploit the increased parallelism by coarsely mapping a single layer at a time across cores, which incurs frequent costly off-chip memory accesses, or by pipelining batches of inputs, which falls short in meeting the demands of latency-critical applications. To alleviate these bottlenecks, this work explores a new fine-grain mapping paradigm, referred to as layer fusion, on heterogeneous dataflow accelerators through a novel design space exploration framework called Stream. Stream captures a wide variety of heterogeneous dataflow architectures and mapping granularities, and implements a memory and communication-aware latency and energy analysis validated with three distinct state-of-the-art hardware implementations. As such, it facilitates a holistic exploration of architecture and mapping, by strategically allocating the workload through constraint optimization. The findings demonstrate that the integration of layer fusion with heterogeneous dataflow accelerators yields up to 2.2x lower energy-delay product in inference efficiency, addressing both energy consumption and latency concerns. The framework is available open-source at: https://github.com/kuleuven-micas/stream.

연구 동기 및 목표

  • 지연 시간이 중요한 실시간 환경에서 자원이 제한된 엣지 DNN 추론에서 기존의 계층별 순차 스케줄링의 비효율성을 해결한다.
  • 계층 융합 DNN의 스케줄링 정밀도와 하드웨어 아키텍처 간의 상호 교환 관계를 체계적으로 탐색할 수 있도록 한다.
  • 다양한 다중코어 가속기 설계에서 스케줄링을 평가하고 최적화할 수 있는 일반화 가능한 오픈소스 모델링 프레임워크를 제공한다.
  • 아키텍처의 이질성과 세밀한 스케줄링이 에너지, 지연 시간, 메모리 효율성에 미치는 영향을 정량화한다.

제안 방법

  • 다양한 스케줄링 정밀도와 하드웨어 아키텍처에 걸쳐 계층 융합 DNN를 위한 통합된 모델링 표현 방식을 개발했다.
  • 융합된 네트워크 내 복잡한 계층 간 및 계층 내 종속 관계를 모델링하기 위해 고속의 세밀한 데이터 종속성 생성기를 구현했다.
  • 융합된 계층을 최적의 처리 코어에 매핑하기 위해 유전 알고리즘 기반의 계층-코어 할당기(allocator)를 활용했다.
  • 에너지, 지연 시간 또는 메모리 점유율을 최소화하는 효율적인 실행 순서를 생성하기 위해 휴리스틱 기반 스케줄러를 통합했다.
  • 측정된 효율성 데이터를 바탕으로 세 가지 최첨단 하드웨어 가속기와의 검증을 수행했다.
  • 7개의 하드웨어 아키텍처와 5개의 DNN를 대상으로 대규모 설계 공간 탐색을 수행하여 최적의 스케줄링 및 아키텍처 조합을 규명했다.

실험 결과

연구 질문

  • RQ1세밀한, 깊이 우선 스케줄링 방식이 기존의 계층별 순차 스케줄링 대비 계층 융합 DNN의 에너지, 지연 시간, 메모리 효율성에 어떤 영향을 미치는가?
  • RQ2단일 코어, 동질적 다중코어, 이질적 다중코어와 같은 고수준 아키텍처 선택이 계층 융합 DNN 실행의 효율성에 어느 정도의 영향을 미치는가?
  • RQ3일반적인 목적의 모델링 프레임워크가 다양한 가속기 설계와 스케줄링 정밀도 간의 하드웨어 효율성을 정확하게 예측할 수 있는가?
  • RQ4스케줄링과 하드웨어 아키텍처를 공동 최적화함으로써 얻을 수 있는 에너지-지연 제품(EDP)의 최대 감소율은 얼마인가?

주요 결과

  • Stream은 계층 융합 스케줄링을 사용하는 세 가지 최첨단 하드웨어 구현체와 비교해 측정값과 5% 이내로 정밀하게 일치시켰다.
  • 단일 코어 아키텍처에서는 계층 융합이 계층별 스케줄링 대비 에너지-지연 제품을 2.4배에서 4.7배까지 감소시켰다.
  • 동질적 다중코어 아키텍처에서는 계층 융합이 계층별 스케줄링 대비 EDP를 10배에서 19배까지 향상시켰다.
  • 이질적 다중코어 아키텍처에서는 계층별 스케줄링 대비 EDP를 최대 30.4배까지 감소시켰으며, 심지어 최상의 동질적 설계보다도 뛰어난 성능을 보였다.
  • 다양한 계층 유형을 포함한 네트워크에서는 이질적 아키텍처가 가장 큰 이점을 제공하지만, SqueezeNet처럼 균일한 네트워크의 경우는 개선 폭이 적거나 성능 저하가 발생할 수 있다.
  • 유전 알고리즘 기반의 계층-코어 할당기가 수동 할당에 비해 뚜렷이 뛰어난 성능을 보이며, 지연 시간과 메모리 점유율을 모두 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.