[논문 리뷰] DNA: Differentiable Network-Accelerator Co-Search
DNA는 최대 정확도와 하드웨어 효율성을 위해 딥 네트워크(DNN) 아키텍처와 가속기 마이크로아키텍처를 함께 최적화하는 미분 가능한 네트워크-가속기 공동 탐색 프레임워크를 제안한다. 일반적인 가속기 설계 공간과 미분 가능한 가속기 탐색 엔진을 통합함으로써 DNA는 기존 최고 수준(SOTA) 대비 최대 3.04배 높은 FPS와 5.46% 높은 ImageNet 정확도를 달성하면서도 탐색 시간을 최대 1234.3배 감소시킨다.
Powerful yet complex deep neural networks (DNNs) have fueled a booming demand for efficient DNN solutions to bring DNN-powered intelligence into numerous applications. Jointly optimizing the networks and their accelerators are promising in providing optimal performance. However, the great potential of such solutions have yet to be unleashed due to the challenge of simultaneously exploring the vast and entangled, yet different design spaces of the networks and their accelerators. To this end, we propose DNA, a Differentiable Network-Accelerator co-search framework for automatically searching for matched networks and accelerators to maximize both the task accuracy and acceleration efficiency. Specifically, DNA integrates two enablers: (1) a generic design space for DNN accelerators that is applicable to both FPGA- and ASIC-based DNN accelerators and compatible with DNN frameworks such as PyTorch to enable algorithmic exploration for more efficient DNNs and their accelerators; and (2) a joint DNN network and accelerator co-search algorithm that enables simultaneously searching for optimal DNN structures and their accelerators' micro-architectures and mapping methods to maximize both the task accuracy and acceleration efficiency. Experiments and ablation studies based on FPGA measurements and ASIC synthesis show that the matched networks and accelerators generated by DNA consistently outperform state-of-the-art (SOTA) DNNs and DNN accelerators (e.g., 3.04x better FPS with a 5.46% higher accuracy on ImageNet), while requiring notably reduced search time (up to 1234.3x) over SOTA co-exploration methods, when evaluated over ten SOTA baselines on three datasets. All codes will be released upon acceptance.
연구 동기 및 목표
- 매우 넓고 복잡하게 얽힌 설계 공간에서 DNN과 가속기를 함께 최적화하는 데 도전하는 것.
- 공동 최적화에서 비미분 가능한 하드웨어 비용과 희박한 최적점의 한계를 극복하는 것.
- FPGA 및 ASIC 기반 가속기 모두와 호환 가능한 확장성 있고 일반적인 가속기 탐색 공간을 개발하는 것.
- 미분 가능한 탐색을 통해 경량 기반의 DNN 및 가속기 공동 설계 탐색을 효율적으로 수행하는 것.
- 전문가가 설계하거나 도구에 의해 생성된 SOTA 가속기보다 정확도와 처리량에서 뛰어나면서도 탐색 시간을 단축시키는 것.
제안 방법
- FPGA 및 ASIC 기반 가속기 모두에 적용 가능한 일반적인 DNN 가속기 설계 공간(GADS)을 도입하여 마이크로아키텍처 및 매핑 방법의 알고리즘적 탐색을 가능하게 한다.
- 강화학습 기반 방법보다 더 효율적으로 큰 이산적 가속기 설계 공간을 탐색할 수 있는 기울기 기반의 탐색 엔진인 미분 가능한 가속기 탐색(DAS)을 개발한다.
- 정확도와 하드웨어 효율성을 동시에 최적화하기 위해 DNN 구조와 가속기 설정을 함께 최적화하는 공동 미분 가능한 공동 탐색 알고리즘을 사용한다.
- 이산적인 아키텍처 선택을 통해 역전파를 가능하게 하여 네트워크와 가속기 양쪽을 종단 간 최적화할 수 있도록 미분 가능한 연산을 활용한다.
- PyTorch와의 통합을 지원하며, 가속기 파라미터에 대한 미분 가능한 탐색을 통해 하드웨어 인식 신경망 아키텍처 탐색을 가능하게 한다.
- 검증을 위해 FPGA 측정치와 ASIC 합성 결과를 활용하며, 설계 공간 샘플링 및 분석 실험을 통해 성능를 평가한다.
실험 결과
연구 질문
- RQ1미분 가능한 공동 탐색 프레임워크는 정확도와 하드웨어 효율성을 동시에 극대화하기 위해 DNN 아키텍처와 가속기 마이크로아키텍처를 공동 최적화할 수 있는가?
- RQ2제안된 미분 가능한 가속기 탐색(DAS) 엔진은 큰 이산적 가속기 설계 공간을 탐색할 때 강화학습 기반 또는 무작위 탐색과 비교해 어떻게 성능을 냈는가?
- RQ3일반적인 가속기 설계 공간(GADS)이 DNN과 가속기의 확장성 있고 하드웨어에 종속되지 않는 공동 설계를 얼마나 잘 가능하게 하는가?
- RQ4DNA의 공동 최적화 전략은 정확도와 처리량에서 SOTA 방법을 능가하면서도 탐색 시간을 어떻게 단축시키는가?
- RQ5DNA가 생성한 네트워크와 가속기에서 나타나는 아키텍처 패턴은 무엇이며, 이는 효율성과 정확도 향상에 어떻게 기여하는가?
주요 결과
- DNA가 생성한 네트워크와 가속기는 ZC706 FPGA에서 ImageNet에서 75.6%의 top-1 정확도와 42 FPS의 처리 속도를 달성하여 SOTA DNN 및 가속기보다 뛰어난 성능을 보였다.
- DNA는 ImageNet에서 SOTA 대비 최대 3.04배 높은 처리량과 5.46% 높은 정확도를 확보하면서도 탐색 시간을 최대 1234.3배 감소시켰다.
- 동일한 FPGA 및 정밀도 제약 조건 하에서 VGG16에서 DAS 엔진은 SOTA 가속기 대비 최대 2.12배 높은 처리량을 기록했다.
- DNA가 생성한 가속기는 레이어별 차원에 맞춰 적응하는 청크 기반 파이ipel라인 아키텍처를 사용하며, 초기 레이어는 공간 차원을 병렬화하고 깊은 레이어는 채널 수준의 병렬 처리를 활용한다.
- 공동 탐색 프레임워크는 깊이 대비 너비를 늘리는 방식의 넓은, 스킵 연결이 있는 아키텍처를 선호하는 네트워크를 발견하여 정확도와 하드웨어 효율성을 동시에 향상시켰다.
- 분석 실험을 통해 DAS는 무작위 탐색 및 강화학습 기반 방법에 비해 탐색 효율성과 최종 성능 모두에서 뚜렷한 우수성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.