[논문 리뷰] Co-Design of Deep Neural Nets and Neural Net Accelerators for Embedded Vision Applications
이 논문은 임베디드 비전 응용 프로그램을 위한 딥 네ural 네트워크(DNN)와 신경망 가속기의 공동 설계 방법론을 제안하며, DNN 아키텍처(SqueezeNext)와 가속기 마이크로아키텍처(Squeezelerator)를 함께 최적화하여 최대 6.3배의 성능 향상과 2.25배의 에너지 절감을 달성한다. 이 방법은 데이터플로우 인지 DNN 설계와 하드웨어 인지 레이어 재구성 기법을 활용하여 하드웨어 활용도를 극대화하고 메모리 액세스 오버헤드를 최소화한다.
Deep Learning is arguably the most rapidly evolving research area in recent years. As a result it is not surprising that the design of state-of-the-art deep neural net models proceeds without much consideration of the latest hardware targets, and the design of neural net accelerators proceeds without much consideration of the characteristics of the latest deep neural net models. Nevertheless, in this paper we show that there are significant improvements available if deep neural net models and neural net accelerators are co-designed.
연구 동기 및 목표
- 최신 DNN 모델과 신경망 가속기 설계 간의 점점 커지는 괴리 문제를 해결하기 위해, 이 둘을 별도로 평가하는 것에서 비롯된 문제를 해결하고자 한다.
- DNN과 가속기를 공동 설계함으로써 임베디드 비전 워크로드에서 뚜렷한 성능, 에너지 효율성, 정확도 향상을 이끌어낼 수 있음을 입증하고자 한다.
- 하드웨어 제약 조건을 DNN 아키텍처 설계에 통합하고 반대로 DNN 설계에 하드웨어 제약을 반영하는 체계적인 접근법을 개발하고자 한다.
- 다양한 데이터플로우(가중치 정적 및 출력 정적)를 지원하는 특화된 가속기(Squeezelerator)를 개발하여 레이어 수준의 최적 성능을 달성하고자 한다.
- Squeezelerator의 마이크로아키텍처적 특성에 맞게 명시적으로 최적화된 새로운 DNN 패밀리(SqueezeNext)를 설계하고자 한다.
제안 방법
- 아키텍처 시뮬레이션과 DNN 설계 간의 피드백 루프를 활용한 DNN과 가속기의 공동 설계 방법으로, 하드웨어 활용도와 메모리 액세스 패턴에 중점을 둔다.
- 각 레이어 기반으로 가중치 정적 및 출력 정적 데이터플로우를 지원하는 Squeezelerator 가속기 설계로, 레이어 특성에 맞게 동적으로 적응할 수 있도록 한다.
- SqueezeNet v1.0을 SqueezeNext로 최적화하기 위해 초기 레이어 필터 크기를 7×7에서 5×5로 감소시키고, 하드웨어 활용도를 향상시키기 위해 레이어 분포를 재구성한다.
- 초기 레이어의 채널 수를 감소시키고, 더 높은 MACs/cycle 비율을 가진 후행 단계로 레이어를 재분배하여, 처리 요소(PE) 활용도를 높이고 메모리 지연을 숨기도록 한다.
- 레지스터 파일 크기를 8에서 16으로 두 배로 늘여 Squeezelerator를 정밀하게 최적화함으로써 국소 데이터 재사용을 향상시키고 외부 메모리 액세스를 줄인다.
- Squeezelerator 및 기준 아키텍처에서 다양한 DNN(SqueezeNet, Tiny Darknet, MobileNet, SqueezeNext)에 대해 성능, 에너지 소비, 정확도를 평가한다.
실험 결과
연구 질문
- RQ1DNN과 가속기를 공동 설계함으로써 임베디드 비전 응용 프로그램의 추론 속도와 에너지 효율성 향상에 측정 가능한 영향을 미칠 수 있는가?
- RQ2DNN 레이어의 하드웨어 활용 패턴은 특히 소형 효율적인 모델에 대해 가속기 설계 선택에 어떤 영향을 미치는가?
- RQ3필터 크기와 레이어 분포와 같은 DNN 아키텍처 수정이 정확도를 희생시키지 않고도 가속기 효율성을 얼마나 향상시킬 수 있는가?
- RQ4하나의 가속기가 레이어 기반으로 다양한 데이터플로우(예: 가중치 정적 및 출력 정적)를 지원함으로써 레이어 특성에 맞게 적응할 수 있는가?
- RQ5레지스터 파일 크기와 데이터 재사용 최적화가 전체 시스템 성능과 에너지 소비에 어떤 영향을 미치는가?
주요 결과
- Squeezelerator 가속기는 다양한 레이어 유형에서 높은 하드웨어 활용도를 확보하면서도, 단일 데이터플로우 가속기 대비 1.1×에서 6.35×까지의 성능 향상을 달성한다.
- Squeezelerator에 공동 설계된 SqueezeNext는 SqueezeNet v1.0 대비 2.59배 빠른 추론 속도와 2.25배 높은 에너지 효율성을 확보했으며, 정확도도 향상되어 상위-1 정확도가 59.2%로 57.1%에서 상승했다.
- 공동 설계 접근법을 통해 AlexNet 대비 8.26배 더 빠른 추론 속도와 7.5배 더 낮은 에너지 소비를 달성했으며, 정확도는 유지하거나 향상시켰다.
- 첫 번째 레이어의 필터 크기를 7×7에서 5×5로 줄이고 레이어 분포를 재구성함으로써 하드웨어 활용도가 크게 향상되었으며, 특히 큰 입력 특징 맵에서 추론 시간이 크게 단축되었다.
- 레지스터 파일 크기를 8에서 16으로 두 배로 늘린 Squeezelerator의 정밀 최적화를 통해 성능 향상이 추가로 이루어졌으며, 반복적인 공동 설계의 가치를 입증했다.
- SqueezeNext 패밀리는 정확도, 에너지 소비, 추론 시간 간의 유리한 트레이드오��� 스펙트럼을 제공하여 응용 프로그램 기반의 모델 선택을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.