[논문 리뷰] Auto-NBA: Efficient and Effective Search Over the Joint Space of Networks, Bitwidths, and Accelerators
Auto-NBA는 신경망, 비트폭, 가속기의 유연한 연합 탐색 프레임워크를 통해 정확도와 효율성을 극대화하는 미분 가능이고 통합된 탐색 방법을 제안한다. 이는 이질적 샘플링과 미분 가능 가속기 탐색 엔진을 도입함으로써 메모리 폭발, 이산적 가속기 설계, 상호의존 문제를 해결하며, 이전의 공통 탐색 방법보다 20.9% 낮은 지연 시간과 0.96% 높은 정확도를 달성하여 최신 기술 수준의 성능을 확보한다.
While maximizing deep neural networks' (DNNs') acceleration efficiency requires a joint search/design of three different yet highly coupled aspects, including the networks, bitwidths, and accelerators, the challenges associated with such a joint search have not yet been fully understood and addressed. The key challenges include (1) the dilemma of whether to explode the memory consumption due to the huge joint space or achieve sub-optimal designs, (2) the discrete nature of the accelerator design space that is coupled yet different from that of the networks and bitwidths, and (3) the chicken and egg problem associated with network-accelerator co-search, i.e., co-search requires operation-wise hardware cost, which is lacking during search as the optimal accelerator depending on the whole network is still unknown during search. To tackle these daunting challenges towards optimal and fast development of DNN accelerators, we propose a framework dubbed Auto-NBA to enable jointly searching for the Networks, Bitwidths, and Accelerators, by efficiently localizing the optimal design within the huge joint design space for each target dataset and acceleration specification. Our Auto-NBA integrates a heterogeneous sampling strategy to achieve unbiased search with constant memory consumption, and a novel joint-search pipeline equipped with a generic differentiable accelerator search engine. Extensive experiments and ablation studies validate that both Auto-NBA generated networks and accelerators consistently outperform state-of-the-art designs (including co-search/exploration techniques, hardware-aware NAS methods, and DNN accelerators), in terms of search time, task accuracy, and accelerator efficiency. Our codes are available at: https://github.com/RICE-EIC/Auto-NBA.
연구 동기 및 목표
- 신경망, 비트폭, 가속기 간의 밀접한 상호의존성에도 불구하고 기존에 별개로 다뤄지는 문제를 해결하기 위해, 이들 간의 통합 최적화가 부족한 점을 보완한다.
- 탐색 과정에서 다양한 비트폭을 순차적으로 훈련함으로써 발생하는 메모리 폭발과 편향된 정확도 순위 문제를 해결한다.
- 네트워크-가속기 공통 탐색에서 발생하는 닭과 계란 문제를 해결하기 위해, 탐색 중에 작업 단위의 하드웨어 비용 추정을 가능하게 하여 해결한다.
- 네트워크, 비트폭, 가속기의 광범위한 연합 설계 공간을 효율적으로 탐색할 수 있는 확장 가능하고 미분 가능한 프레임워크를 개발한다.
- 기존의 공통 탐색, 하드웨어 인식 NAS, DNN 가속기 설계 방법보다 정확도, 지연 시간, 탐색 효율성 측면에서 뛰어난 성능을 달성한다.
제안 방법
- 다양한 비트폭 선택과 가중치를 동시에 업데이트하는 이질적 샘플링 전략을 도입하여 순차적 훈련을 피하고 정확도 순위의 편향을 방지한다.
- 가속기 마이크로아키텍처(예: 메모리 계층, 루프 타일링, 처리 어레이 크기)를 연속 변수로 모델링하여 기울기 기반 최적화가 가능한 미분 가능 가속기 탐색 엔진을 활용한다.
- 엔드 투 엔드로 미분 가능한 방식으로 네트워크 아키텍처, 비트폭, 가속기 구성 설정을 동시에 최적화하는 통합 탐색 파이프라인을 적용한다.
- 큰 설계 공간에서의 연합 탐색 중 메모리 폭발을 방지하기 위해 일정 메모리 사용 샘플링 기법을 적용한다.
- 네트워크 탐색 중 알려지지 않은 최적의 가속기 설계 문제를 해결하기 위해 탐색 중 이론적 하드웨어 비용 추정을 활용한다.
- DSP 및 면적 제약 조건 하에서 정확도와 추론 속도의 균형을 맞추기 위해 파레토 경계 기반 평가를 적용한다.
실험 결과
연구 질문
- RQ1메모리나 시간 비용이 금지적이지 않은 상황에서, 신경망, 비트폭, 가속기를 동시에 최적화할 수 있는 미분 가능이고 통합된 탐색 프레임워크는 효과적으로 작동할 수 있는가?
- RQ2이산적이고 비미분 가능한 가속기 설계는 어떻게 미분 가능한 탐색 파이프라인에 통합될 수 있는가?
- RQ3이질적 샘플링 전략은 연속적 또는 균일한 샘플링 대비 정확도 순위 및 메모리 효율성 측면에서 더 나은 성능을 보일 수 있는가?
- RQ4네트워크, 비트폭, 가속기를 통합 최적화할 경우, 순차적 또는 부분 최적화 대비 하드웨어 효율성과 모델 정확도가 얼마나 향상되는가?
- RQ5제안된 프레임워크는 실세계의 FPGA 및 ASIC 구현 환경에서 최신 기술 수준의 공통 탐색 및 하드웨어 인식 NAS 방법보다 뛰어난 성능을 달성할 수 있는가?
주요 결과
- Auto-NBA는 동일한 면적 소비 조건에서 CIFAR-100에서 NHAS 공통 탐색 기준선 대비 0.96% 높은 정확도와 20.9% 낮은 지연 시간을 기록하여 뛰어난 효율성과 정확도를 입증한다.
- 이질적 샘플링 전략은 편향 없는 비트폭 순위 및 일정한 메모리 사용을 가능하게 하여 순차적 훈련 및 균일한 샘플링 방법보다 뛰어난 성능을 보인다.
- Auto-NBA는 순차적 최적화 기준선을 지속적으로 능가하며, 정확도는 1.95% 높고 FPS는 1.75배 향상되어 이론적 지표와 실제 하드웨어 효율성 지표 간의 낮은 상관관계를 드러낸다.
- 검색된 네트워크들은 FPGA 환경에서 넓고 얕은 아키텍처를 선호하며, 이를 통해 특징/채널 단위의 병렬성을 더 효과적으로 활용해 처리량을 극대화한다.
- 검색된 가속기들은 네트워크를 파이프라인된 블록으로 분할하며, 초기 레이어는 공간 차원을 타일링하고 깊은 레이어는 채널 차원을 타일링하여 병렬성과 자원 활용도를 극대화한다.
- Auto-NBA는 DSP 및 면적 제약 조건의 다양한 범위에서 확장 가능한 성능을 보이며, 다양한 하드웨어 사양에 대한 강건성과 적응 가능성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.