[논문 리뷰] Discovering Multi-Hardware Mobile Models via Architecture Search
이 논문은 CPU, GPU, DSP, EdgeTPU 등 여러 가속기들을 고려해 최적화된 단일 모델을 개발하기 위해 다중 하드웨어 신경망 아키텍처 탐색을 제안한다. 이는 배포 및 엔지니어링 오버헤드를 줄인다. 다중 하드웨어 메트릭과 호환성 있는 검색 공간을 도입함으로써, 단일 검색 과정에서 모든 하드웨어에서 최고 성능을 내는 모델를 발견할 수 있으며, 평균 및 최악의 경우 지연 시간에서 단일 하드웨어 모델을 초월하면서도 검색 비용을 5배 줄였다.
Hardware-aware neural architecture designs have been predominantly focusing on optimizing model performance on single hardware and model development complexity, where another important factor, model deployment complexity, has been largely ignored. In this paper, we argue that, for applications that may be deployed on multiple hardware, having different single-hardware models across the deployed hardware makes it hard to guarantee consistent outputs across hardware and duplicates engineering work for debugging and fixing. To minimize such deployment cost, we propose an alternative solution, multi-hardware models, where a single architecture is developed for multiple hardware. With thoughtful search space design and incorporating the proposed multi-hardware metrics in neural architecture search, we discover multi-hardware models that give state-of-the-art (SoTA) performance across multiple hardware in both average and worse case scenarios. For performance on individual hardware, the single multi-hardware model yields similar or better results than SoTA performance on accelerators like GPU, DSP and EdgeTPU which was achieved by different models, while having similar performance with MobilenetV3 Large Minimalistic model on mobile CPU.
연구 동기 및 목표
- 다양한 가속기들을 위한 별도의 단일 하드웨어 모델을 유지하는 데 드는 높은 배포 및 엔지니어링 비용을 해결하기 위해.
- 다양한 하드웨어 플랫폼을 대상으로 하는 애플리케이션에서 모델의 배포 복잡성을 줄이기 위해.
- 여러 하드웨어를 동시에 최적화하는 통합 신경망 아키텍처 탐색 프레임워크를 개발하기 위해.
- 이종 엣지 디바이스 간의 성능과 이식 가능성 사이의 트레이드오프를 최소화하기 위해.
제안 방법
- 모든 대상 가속기(CPU float, CPU uint8, GPU, DSP, EdgeTPU)와 호환 가능한 다중 하드웨어 검색 공간을 설계하여 공통 아키텍처 탐색을 가능하게 하였다.
- 다양한 하드웨어 플랫폼에서의 모델 효율성을 평가하기 위해 정규화된 평균 및 최악의 경우 지연 시간 메트릭을 도입하였다.
- 기존 NAS 보상 함수를 수정하여 정확도와 다중 하드웨어 지연 시간 성능를 모두 고려하도록 하였다.
- 공통 검색 공간과 통합 최적화를 통해 모든 대상 하드웨어에서 잘 작동하는 단일 모델을 발견하였다.
- 모든 NAS 알고리즘과 호환 가능한 보완적 검색 방법을 적용하여 다양한 하드웨어 구성으로 확장 가능하도록 하였다.
- 각 대상 장치에서 실제 성능을 확보하기 위해 검색 중 하드웨어 인식 지연 측정을 활용하였다.
실험 결과
연구 질문
- RQ1특정 하드웨어에만 유리한 연산을 제거함으로써 효율성을 희생시키지 않고도 다수의 이종 모바일 가속기에서 경쟁적인 성능을 내는 단일 신경망 아키텍처를 달성할 수 있는가?
- RQ2다중 하드웨어 NAS는 단일 하드웨어 NAS에 비해 정확도, 지연 시간, 검색 비용 측면에서 어떻게 비교되는가?
- RQ3다중 하드웨어 모델은 단일 하드웨어 모델과 비교해 어떤 설계 선택을 보이는가?
- RQ4다중 하드웨어 메트릭(평균 및 최악의 경우 지연 시간)은 다양한 하드웨어에서 실제 성능과 어떻게 상관관계가 있는가?
- RQ5다중 하드웨어 모델은 검색에 포함되지 않은 타겟 외 하드웨어로도 일반화 가능한가?
주요 결과
- 다중 하드웨어 모델(Multi-AVG)은 CPU float, CPU uint8, GPU, DSP, EdgeTPU 등 다섯 가지 하드웨어 플랫폼에서 평균 및 최악의 경우 지연 시간 모두 최고 성능을 내는 정확도-지연 시간 트레이드오프를 달성하였다.
- Multi-AVG는 ImageNet top-1 정확도 75.8%를 기록했으며, 정규화된 평균 지연 시간은 1.06, 최악의 경우 지연 시간은 1.25로, 평균 및 최악의 경우 지표에서 단일 하드웨어 모델을 모두 초월하였다.
- 다중 하드웨어 검색 과정은 다섯 개의 별도 단일 하드웨어 검색을 수행하는 것에 비해 총 검색 비용을 5배 줄였다.
- 발견된 다중 하드웨어 모델은 타겟 외 하드웨어로도 잘 일반화되며, 예상치 못한 가속기에서도 뛰어난 성능을 보였다.
- 다중 하드웨어 모델은 특정 하드웨어에서만 유리한 연산인 SE 및 h-swish와 같은 연산을 피하고, 후행 레이어를 더 두껍게 구성함으로써 다중 플랫폼 효율성에 초점을 맞추고 있음을 보여주었다.
- Multi-AVG 모델은 GPU, DSP, EdgeTPU에서 작업 특화 단일 하드웨어 모델의 성능을 따라하거나 초월하였으며, 모바일 CPU에서 MobileNetV3 Large Minimalistic과 유사한 성능을 유지하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.