[논문 리뷰] S3NAS: Fast NPU-aware Neural Architecture Search Methodology
S3NAS는 단일 경로 NAS와 복합 스케일링을 활용하여 지연 시간 제약 조건을 고려한 단일 경로 NAS 및 변동하는 스테이지 깊이와 혼합 커널 크기 블록을 포함한 슈퍼넷 구조를 확장함으로써 검색 효율성과 정확도를 향상시키는 빠르고 NPU에 적합한 신경망 아키텍처 탐색 방법을 제안한다. TPUv3에서 3시간 만에 11.66ms 지연 시간으로 ImageNet의 top-1 정확도 82.72%를 달성하며 기존 모델 및 무작위 검색 기반 기준선을 능가한다.
As the application area of convolutional neural networks (CNN) is growing in embedded devices, it becomes popular to use a hardware CNN accelerator, called neural processing unit (NPU), to achieve higher performance per watt than CPUs or GPUs. Recently, automated neural architecture search (NAS) emerges as the default technique to find a state-of-the-art CNN architecture with higher accuracy than manually-designed architectures for image classification. In this paper, we present a fast NPU-aware NAS methodology, called S3NAS, to find a CNN architecture with higher accuracy than the existing ones under a given latency constraint. It consists of three steps: supernet design, Single-Path NAS for fast architecture exploration, and scaling. To widen the search space of the supernet structure that consists of stages, we allow stages to have a different number of blocks and blocks to have parallel layers of different kernel sizes. For a fast neural architecture search, we apply a modified Single-Path NAS technique to the proposed supernet structure. In this step, we assume a shorter latency constraint than the required to reduce the search space and the search time. The last step is to scale up the network maximally within the latency constraint. For accurate latency estimation, an analytical latency estimator is devised, based on a cycle-level NPU simulator that runs an entire CNN considering the memory access overhead accurately. With the proposed methodology, we are able to find a network in 3 hours using TPUv3, which shows 82.72% top-1 accuracy on ImageNet with 11.66 ms latency. Code are released at https://github.com/cap-lab/S3NAS
연구 동기 및 목표
- NPU 하드웨어에서 엄격한 지연 시간 제약 조건 하에 고정확도 CNN 아키텍처를 찾는 데 도전하는 것.
- 하드웨어 인식 지연 시간 추정과 효율적인 검색 전략을 활용하여 NPU 플랫폼에서의 NAS에 대한 검색 시간과 검색 공간을 줄이는 것.
- 슈퍼넷 아키텍처를 확장하고 검색 후 복합 스케일링을 적용하여 정확도-지연 시간 트레이드오���을 향상시키는 것.
- 슈퍼넷 설계와 지연 시간 인식 검색이 NAS에서 검색 전략 자체보다 더 큰 영향을 미친다는 것을 입증하는 것.
제안 방법
- 각 스테이지의 블록 수를 변동 가능하게 하고, 서로 다른 커널 크기를 가진 병렬 레이어(혼합 depthwise 컨볼루션)를 추가하여 검색 공간을 넓히기 위해 단일 경로 NAS 슈퍼넷을 확장한다.
- 목표 지연 시간보다 더 엄격한 지연 시간 제약 조건을 적용한 수정된 단일 경로 NAS를 사용하여 검색 공간을 줄이고 아키텍처 탐색 속도를 높인다.
- 플랫폼에 특화된 성능을 반영하기 위해 MAC 수 대신 사이클 수준의 NPU 시뮬레이터를 사용하여 정확한 지연 시간 추정을 수행한다.
- 발견된 기본 아키텍처에 대해 복합 스케일링을 수행하여 목표 지연 시간 예산 내에서 더 큰 모델을 생성한다.
- 정확도를 추가로 향상시키기 위해 압축-확장(SE) 블록과 h-swish 활성화 함수와 같은 후처리 향상 기법을 도입한다.
- 학습 가능한 가중치를 통해 아키텍처 성능를 유도하는 일회성, 미분 가능한 NAS 접근 방식을 사용하여 단 하나의 슈퍼넷만을 훈련시킨다.
실험 결과
연구 질문
- RQ1변동하는 스테이지 깊이와 혼합 커널 크기 블록을 포함한 슈퍼넷 구조 확장이 NPU 플랫폼에서의 정확도-지연 시간 트레이드오프에 상당한 영향을 미칠 수 있는가?
- RQ2단일 경로 NAS 검색 중 더 엄격한 지연 시간 제약 조건을 적용하면 검색 시간은 줄어들지만 여전히 고정확도 아키텍처를 도출할 수 있는가?
- RQ3NPU 하드웨어에서 느슨한 지연 시간 제약 조건 하에 기본 아키텍처를 확장하는 데 있어 직접 검색 대비 복합 스케일링의 효과는 어느 정도인가?
- RQ4SE 블록과 h-swish 활성화 함수와 같은 아키텍처 구성 요소가 NPU 최적화 모델의 정확도 향상에 어느 정도 기여하는가?
주요 결과
- S3NAS는 목표 NPU에서 11.66ms 지연 시간으로 ImageNet의 top-1 정확도 82.72%를 달성하며, 동일한 지연 시간 제약 조건 하에서 기존 모델을 능가한다.
- 이 방법은 TPUv3에서 아키텍처 검색을 단 3시간 내에 완료하여 높은 효율성을 입증한다.
- 무작위 검색 및 무작위 선택 방법은 경쟁력이 있었지만 최대 79.19%의 top-1 정확도를 기록하여 제안된 검색 전략의 우수성을 확인한다.
- SE 블록과 h-swish 활성화 함수의 조합은 ReLU 기반 기준선 대비 약 1%의 정확도 향상을 이룬다.
- 대규모 네트워크를 위한 직접 검색은 TPUv3에서 10시간이 소요되었지만, 복합 스케일링은 더 효율적으로 유사한 결과를 도출하여 그 효과를 입증한다.
- 연구 결과는 슈퍼넷 아키텍처 설계가 검색 전략보다 최종 정확도에 더 큰 영향을 미친다는 것을 확인하였으며, 제안된 방법과 무작위 방법 간의 일관된 성능 격차로 이를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.