[논문 리뷰] Standing on the Shoulders of Giants: Hardware and Neural Architecture Co-Search with Hot Start
HotNAS는 사전 훈련된 모델(즉, '핫 스타트')에서 시작하는 하드웨어 및 신경망 아키텍처 공동 탐색 프레임워크를 제안한다. 이를 통해 기존의 수백 시간의 GPU 시간이 소요되던 탐색 시간을 3시간 미만으로 단축시킨다. 모델 압축을 하드웨어 인식 신경망 아키텍처 탐색 파이프라인과 통합함으로써, Xilinx FPGA에서 5ms 지연 시간 제약 조건 하에 ImageNet에서 최대 5.79%의 Top-1 및 3.97%의 Top-5 정확도 향상을 달성한다.
Hardware and neural architecture co-search that automatically generates Artificial Intelligence (AI) solutions from a given dataset is promising to promote AI democratization; however, the amount of time that is required by current co-search frameworks is in the order of hundreds of GPU hours for one target hardware. This inhibits the use of such frameworks on commodity hardware. The root cause of the low efficiency in existing co-search frameworks is the fact that they start from a "cold" state (i.e., search from scratch). In this paper, we propose a novel framework, namely HotNAS, that starts from a "hot" state based on a set of existing pre-trained models (a.k.a. model zoo) to avoid lengthy training time. As such, the search time can be reduced from 200 GPU hours to less than 3 GPU hours. In HotNAS, in addition to hardware design space and neural architecture search space, we further integrate a compression space to conduct model compressing during the co-search, which creates new opportunities to reduce latency but also brings challenges. One of the key challenges is that all of the above search spaces are coupled with each other, e.g., compression may not work without hardware design support. To tackle this issue, HotNAS builds a chain of tools to design hardware to support compression, based on which a global optimizer is developed to automatically co-search all the involved search spaces. Experiments on ImageNet dataset and Xilinx FPGA show that, within the timing constraint of 5ms, neural architectures generated by HotNAS can achieve up to 5.79% Top-1 and 3.97% Top-5 accuracy gain, compared with the existing ones.
연구 동기 및 목표
- 목표 하드웨어당 수백 시간의 GPU 시간이 소요되는 현재의 하드웨어 및 신경망 아키텍처 공동 탐색 프레임워크의 비효율성을 해결한다.
- 모델 저지대에서의 사전 훈련된 모델을 활용하여 냉시작 탐색의 병목 현상을 해결하고 수렴 속도를 향상시킨다.
- 모델 압축을 공동 탐색 공간에 통합하여 정확도를 유지하면서 지연 시간을 줄인다.
- 하드웨어 설계, 신경망 아키텍처, 압축 공간 간의 글로벌 최적화된 결합된 탐색 파이프라인을 개발한다.
- 엄격한 시간 제약 조건을 가진 실시간 엣지 응용 프로그램을 위해 빠르고 정확하며 하드웨어 인식 모델 생성을 가능하게 한다.
제안 방법
- 수동으로 설계된, NAS로 특정된, 또는 전이 학습된 모델를 포함한 기존 모델 저지대를 활용해 '핫 스타트' 방식으로 탐색을 시작한다.
- iDetect를 사용해 후보 모델의 하드웨어 성능 병목(예: 메모리 대역폭, 계산 활용도)을 식별한다.
- iDetect 결과를 기반으로 iSpace 탐색 공간을 구성하며, 이는 신경망 아키텍처 변형(예: 깊이, 너비, 커널 크기), 하드웨어 루프 타일링, 압축 기법(예: 프루닝)을 포함한다.
- 정확도와 지연 시간을 고려한 보상 함수(가중치는 초수준 파rameter α)를 가진 강화 학습 기반 최적화기인 iSearch를 사용해 모든 탐색 공간에서 공동 최적화를 수행한다.
- iDesign를 활용해 후보 설계의 지연 시간과 자원 사용량을 예측하는 성능 모델을 구축함으로써 전체 합성 없이도 빠른 평가를 가능하게 한다.
- 두 단계로 구성된 미세조정 프로세스를 적용한다: 빠른 탐색을 위한 작은 배치 크기(β=10)로 탐색을 빠르게 수행한 후, 최종 정확도 검증을 위한 정밀도 유지 미세조정(β=195)을 수행한다.
실험 결과
연구 질문
- RQ1사전 훈련된 모델을 활용한 '핫 스타트' 방식이 하드웨어 및 신경망 아키텍처 공동 탐색에 소요되는 시간을 크게 줄일 수 있는가?
- RQ2공동 탐색 공간에 모델 압축을 통합할 경우, 지연 시간, 정확도, 하드웨어 효율성 간의 트레이드오���에 어떤 영향을 미치는가?
- RQ3하드웨어 설계, 신경망 아키텍처, 압축 공간 간의 결합된 최적화가 엄격한 시간 제약 조건을 충족시키는 데 얼마나 효과적으로 수행될 수 있는가?
- RQ4제안된 프레임워크는 기존의 최고 수준의 정확도를 달성하면서도 탐색 시간을 수백 시간의 GPU 시간에서 3시간 이내로 줄일 수 있는가?
- RQ5보상 함수의 초수준 파rameter α의 선택이 최종 설계에서 정확도와 지연 시간의 균형에 어떤 영향을 미치는가?
주요 결과
- HotNAS는 ImageNet에 대해 약 200 GPU 시간(냉시작)에서 3시간 미만으로 탐색 시간을 단축시키며, 프oxy 데이터셋을 사용하지 않았다.
- Xilinx ZCU 102 FPGA에서 5ms 지연 시간 제약 조건 하에, HotNAS는 최고 수준의 기존 모델 대비 5.79%의 Top-1 및 3.97%의 Top-5 정확도 향상을 달성했다.
- CIFAR-10에 대해 HotNAS는 정확도를 최대 0.10% 향상시켰고(MobileNet 기준), 지연 시간을 최대 48.26% 감소시켰다(BitNet 기준), 빠른 탐색 모드를 사용해 20분의 탐색 시간을 기록했다.
- 빠른 탐색 모드(β=10)는 빠른 탐색을 통해 경쟁 가능한 정확도를 달성했으며, 예를 들어 DenseNet의 1-에폭 탐색 대비 0.11% 높은 정확도를 확보했고, 탐색 시간은 20분 미만으로 단축되었다.
- α=0.7(정확도 중심)의 보상 함수는 약 160 에피소드 후 수렴하며, 2ms 지연 시간 기준에 근접한 모델을 생성한다. 반면 α=0.3(지연 시간 중심)의 경우 더 빠른 수렴(약 120 에피소드)을 보이며 낮은 지연 시간을 달성한다.
- 지연 시간 제약 조건을 위반할 경우, 학습을 조기에 종료함으로써 비가능한 설계를 빠르게 걸러내는 등, 이 프레임워크의 효율성이 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.