Skip to main content
QUICK REVIEW

[논문 리뷰] HERALD: Optimizing Heterogeneous DNN Accelerators for Edge Devices.

Hyoukjun Kwon, Liangzhen Lai|arXiv (Cornell University)|2019. 09. 13.
Advanced Neural Network Applications참고 문헌 33인용 수 13
한 줄 요약

HERALD는 이질적 딥 뉴럴 네트워크 가속기(HDAs)를 위한 공동 최적화 프레임워크로, 에너지-지연 제품(EDP)을 최소화하기 위해 하드웨어 파artitioning과 레이어 스케줄링을 동시에 결정한다. DNN 레이어의 의존성 그래프 구조를 활용함으로써 최적화 복잡도를 감소시키고, 다양한 워크로드와 가속기 구성에서 단일 구조 가속기 대비 평균 56.0%의 EDP 향상을 달성한다.

ABSTRACT

New real time applications such as virtual reality (VR) with multiple sub-tasks (e.g., image segmentation, hand tracking, etc.) based on deep neural networks (DNNs) are emerging. Such applications rely on multiple DNNs for each sub-task with heterogeneity and require to meet target processing rates for each sub-task. Thus, the new compound DNN workload imposes new challenges to accelerator designs in two folds: (1) meeting target processing rate for each DNN for sub-tasks and (2) efficiently processing heterogeneous layers. As a solution, we explore heterogeneous DNN accelerators (HDAs). HDAs consist of multiple accelerator substrates (i.e., sub-accelerators) to support model parallelism that implements different mapping styles to provide adaptivity to heterogeneous DNN layers. However, HDA's performance and energy heavily depend on (1) how we partition hardware resources for sub-accelerators, and (2) how we schedule layers on the sub-accelerators. Therefore, we propose an HDA optimization framework, Herald, which performs co-optimization of hardware partitioning and layer schedluing. Herald exploits the simplicity of dependence graph of DNN layers to reduce the complexity of the problem, which on average requires 9.48 ms per layer on a laptop with i9-9880H processor and 16GB memory. Herald can be utilized both in design time to perform co-optimization (optimizer) and in compile time to perform layer scheduling and report expected latency and energy (cost model/scheduler). In our case studies, co-optimized HDAs with the best EDP Herald identified provided 56.0% EDP improvements with 46.82% latency and 6.3% energy benefits on average across workloads and accelerators we evaluate compared to the best monolithic accelerators for each evaluation setting by deploying two complementary-style sub-accelerators in an HDA.

연구 동기 및 목표

  • VR과 같은 실시간 엣지 애플리케이션에서 하위 작업을 포함한 여러 이질적 DNN의 목표 처리 속도를 충족시키는 도전 과제를 해결한다.
  • 이질적 DNN 레이어를 처리할 때 단일 구조 가속기의 성능 및 에너지 비효율성을 극복한다.
  • 이질적 DNN 가속기(HDAs)에서 하드웨어 자원 파artitioning과 레이어 스케줄링을 공동 최적화하여 에너지-지연 제품(EDP)을 향상시킨다.
  • 경량 비용 모델을 통해 컴파일 타임 스케줄링과 지연/에너지 추정을 가능하게 한다.

제안 방법

  • HDAs용 하위가속기 자원 할당과 레이어 스케줄링을 동시에 결정하는 공동 최적화 프레임워크인 HERALD를 제안한다.
  • DNN 레이어 의존성 그래프의 단순성을 활용하여 최적화 문제의 계산 복잡도를 감소시킨다.
  • 최소 EDP를 위한 하드웨어 파artitioning과 스케줄링을 공동 최적화하는 디자인 타임 최적화기 구현한다.
  • HERALD의 공동 최적화 구성 기반으로 지연과 에너지를 예측하는 컴파일 타임 비용 모델과 스케줄러를 개발한다.
  • 노트북 기반 프로토타입을 사용하여 최적화 오버헤드를 평가하였으며, 평균 각 레이어당 9.48 ms의 시간을 기록했다.

실험 결과

연구 질문

  • RQ1엣지 장치용 이질적 DNN 가속기에서 하드웨어 파artitioning과 레이어 스케줄링을 어떻게 공동 최적화하여 EDP를 최소화할 수 있는가?
  • RQ2단일 구조 설계 대비 상보적 스타일의 하위가속기 사용이 성능과 에너지 효율성에 미치는 영향은 무엇인가?
  • RQ3다양한 DNN 워크로드와 가속기 구성에 걸쳐 최적화 프레임워크는 얼마나 효율적으로 확장될 수 있는가?
  • RQ4시간과 자원 사용 측면에서 공동 최적화 프로세스의 계산 오버헤드는 얼마나 되는가?

주요 결과

  • HERALD는 평가된 워크로드와 구성 전반에서 최상의 단일 구조 가속기 대비 평균 56.0%의 EDP 감소를 달성한다.
  • 공동 최적화된 HDAs는 평균 지연을 46.82% 감소시키고 평균 에너지 소비를 6.3% 감소시킨다.
  • 최적화 프로세스는 표준 랩탑에서 평균 레이어당 9.48 ms의 시간만 소요되어 디자인 타임 사용에 실용적이다.
  • 프레임워크는 비용 모델과 스케줄러를 통해 정확한 컴파일 타임 지연 및 에너지 예측을 가능하게 한다.
  • HDAs에서 두 개의 상보적 스타일 하위가속기의 사용은 이질적 DNN 레이어에 대한 적응성과 효율성을 크게 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.