[논문 리뷰] Co-Exploration of Neural Architectures and Heterogeneous ASIC Accelerator Designs Targeting Multiple Tasks
이 논문은 엣지 디바이스에서 다중 AI 워크로드를 위한 신경망 아키텍처 탐색(NAS)과 이질적 ASIC 가속기 설계를 동시에 최적화하는 NASAIC라는 공동 탐색 프레임워크를 제안한다. 기존에 검증된 데이터플로우 기반의 사전 정의된 ASIC 템플릿을 활용하여, 다중 작업 RNN 컨트롤러를 통해 DNN 아키텍처와 하드웨어 자원 할당을 공동 최적화함으로써, 순차적 NAS-ASIC 최적화 대비 17.77% 낮은 지연, 2.49배 적은 에너지 소비, 2.32배 더 작은 면적을 달성하면서도 평균 0.76%의 정확도 손실만을 유지하고 설계 사양을 충족시킨다.
Neural Architecture Search (NAS) has demonstrated its power on various AI accelerating platforms such as Field Programmable Gate Arrays (FPGAs) and Graphic Processing Units (GPUs). However, it remains an open problem, how to integrate NAS with Application-Specific Integrated Circuits (ASICs), despite them being the most powerful AI accelerating platforms. The major bottleneck comes from the large design freedom associated with ASIC designs. Moreover, with the consideration that multiple DNNs will run in parallel for different workloads with diverse layer operations and sizes, integrating heterogeneous ASIC sub-accelerators for distinct DNNs in one design can significantly boost performance, and at the same time further complicate the design space. To address these challenges, in this paper we build ASIC template set based on existing successful designs, described by their unique dataflows, so that the design space is significantly reduced. Based on the templates, we further propose a framework, namely NASAIC, which can simultaneously identify multiple DNN architectures and the associated heterogeneous ASIC accelerator design, such that the design specifications (specs) can be satisfied, while the accuracy can be maximized. Experimental results show that compared with successive NAS and ASIC design optimizations which lead to design spec violations, NASAIC can guarantee the results to meet the design specs with 17.77%, 2.49x, and 2.32x reductions on latency, energy, and area and with 0.76% accuracy loss. To the best of the authors' knowledge, this is the first work on neural architecture and ASIC accelerator design co-exploration.
연구 동기 및 목표
- 응용 프로그램 특화 통합 회로(ASIC) 설계와 신경망 아키텍처 탐색(NAS)을 통합하는 데 도전하는 것. 이는 ASIC가 가장 높은 에너지 효율성과 성능를 제공하지만, 이 분야는 여전히 탐색되지 않은 분야이다.
- 기존 가속기들인 Shidiannao, NVDLA, Eyeriss와 같은 설계에서 유래한 검증된 데이터플로우 스타일을 기반으로, 재사용 가능한 템플릿 세트를 만들어 광범위한 ASIC 설계 공간을 축소하는 것.
- 엣지 디바이스에서 동시 다중 작업 워크로드를 위해 다수의 DNN 아키텍처와 이질적 ASIC 서브가속기 설계를 공동 최적화하여 모든 설계 사양을 충족시키는 것.
- 다양한 작업에 대해 최적의 신경망 아키텍처와 하드웨어 자원 할당을 동시에 결정하는 통합 프레임워크를 개발하여 순차적 최적화에서 발생하는 부분 최적 해를 피하는 것.
제안 방법
- NASAIC는 기존에 성공한 설계를 기반으로 하여 각각 고유한 데이터플로우로 정의된 ASIC 가속기 템플릿 라이브러리를 구성함으로써 설계 공간을 템플릿 선택과 자원 할당으로 축소한다.
- 다중 작업 RNN 컨트롤러를 신규로 설계하여 다수의 DNN에 대한 하이퍼파rameter를 동시에 예측하고, 선택된 템플릿 기반으로 하드웨어 자원(예: 처리 엔진, NoC 대역폭)을 할당한다.
- 각 DNN-템플릿 구성에 대해 지연, 에너지, 면적을 추정하는 비용 모델을 통합하여 설계 제약 조건 하에서 효율적인 탐색을 가능하게 한다.
- NASAIC는 신경망 아키텍처와 하드웨어 설계 공간을 공동 탐색하여 사용자가 정의한 모든 설계 사양(지연, 에너지, 면적)을 충족시킨다.
- 강화 학습을 사용하여 컨트롤러를 훈련시키며, 정확도를 최대화하면서 하드웨어 제약 조건을 준수한다. 보상 함수는 정확도와 제약 조건 준수를 통합한다.
- 이 프레임워크는 동일한 가속기 구성과 이질적 가속기 구성 모두를 지원하여, 다양한 워크로드에 대해 동일하거나 다른 서브가속기를 탐색할 수 있다.
실험 결과
연구 질문
- RQ1신경망 아키텍처와 ASIC 가속기 설계를 공동 탐색함으로써 순차적 최적화에 비해 하드웨어 효율성과 정확도를 크게 향상시킬 수 있는가?
- RQ2다양한 워크로드를 위한 설계 유연성을 유지하면서도 막대한 ASIC 설계 공간을 효과적으로 줄일 수 있는 방법은 무엇인가?
- RQ3각각 다른 DNN에 최적화된 이질적 서브가속기 사용이 전체 시스템 성능과 에너지 효율성에 미치는 영향는 어떠한가?
- RQ4공유된 설계 제약 조건 하에서 하나의 통합 컨트롤러가 동시에 여러 DNN과 그에 대응하는 하드웨어 가속기를 공동 최적화할 수 있는가?
- RQ5설계 사양을 충족시키는 데서 특히 성능과 정확도 측면에서 NASAIC는 순차적 NAS-ASIC 및 ASIC-NAS 워크플로우에 비해 어떻게 비교되는가?
주요 결과
- NASAIC는 W1 및 W2 워크로드 모두에 대해 모든 설계 사양(지연, 에너지, 면적)을 준수하지만, 순차적 NAS→ASIC 최적화는 100%의 설계 사양 위반을 초래한다.
- 워크로드 W1에 대해 NASAIC는 NAS→ASIC 접근 방식 대비 17.77% 낮은 지연, 2.49배 적은 에너지 소비, 2.32배 더 작은 면적을 달성하면서도 평균 0.76%의 정확도 손실 뿐이다.
- 워크로드 W2에 대해 NASAIC는 지연을 30.39%, 에너지를 29.58%, 면적을 30.85% 줄였으며, 다시 한번 최소한의 정확도 손실을 유지한다.
- NASAIC는 ASIC→HW-NAS 접근 방식을 초월하여 CIFAR-10에서 0.87% 높은 정확도를 달성했으며, Nuclei에서는 유사한 정확도를 유지했지만 후자의 솔루션은 설계 사양에 더 가까웠다.
- 동일한 CIFAR-10 워크로드(W3)에서 NASAIC는 이질적 가속기를 사용해 93.23%의 정확도를 달성했으며, 이는 NAS 기준선인 94.17%에 가깝게 유지했고 모든 사양을 충족시켰다. 반면 단일 및 동일한 가속기 설계는 자원 제약으로 인해 더 낮은 정확도를 보였다.
- NASAIC는 이질적 서브가속기에서 두 개의 서로 다른 DNN(93.23% 및 91.11% 정확도)을 생성함으로써 앙상블 학습을 가능하게 하여, 동일하거나 단일 가속기에서는 확보할 수 없는 설계의灵活性를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.