Skip to main content
QUICK REVIEW

[논문 리뷰] Single-Path Mobile AutoML: Efficient ConvNet Design and NAS Hyperparameter Optimization

Dimitrios Stamoulis, Ruizhou Ding|arXiv (Cornell University)|2019. 07. 01.
Advanced Neural Network Applications참고 문헌 60인용 수 34
한 줄 요약

이 논문은 각 레이어당 단일 공유 슈퍼 커널 내에 모든 후보 연산을 인코딩함으로써 다중 경로 오버헤드를 제거하고, TPU-v3에서 8 에포크의 훈련만으로도 최대 5,000배 빠른 3시간 미만의 검색 비용을 달성하는 단일 경로 NAS를 제안한다. 이는 80ms 이내의 지연에서 75.62%의 상위-1 ImageNet 정확도를 달성하여 기존의 모바일 NAS 방법을 뛰어넘으며, 상태최저 수준의 성능을 확보한다.

ABSTRACT

Can we reduce the search cost of Neural Architecture Search (NAS) from days down to only few hours? NAS methods automate the design of Convolutional Networks (ConvNets) under hardware constraints and they have emerged as key components of AutoML frameworks. However, the NAS problem remains challenging due to the combinatorially large design space and the significant search time (at least 200 GPU-hours). In this work, we alleviate the NAS search cost down to less than 3 hours, while achieving state-of-the-art image classification results under mobile latency constraints. We propose a novel differentiable NAS formulation, namely Single-Path NAS, that uses one single-path over-parameterized ConvNet to encode all architectural decisions based on shared convolutional kernel parameters, hence drastically decreasing the search overhead. Single-Path NAS achieves state-of-the-art top-1 ImageNet accuracy (75.62%), hence outperforming existing mobile NAS methods in similar latency settings (~80ms). In particular, we enhance the accuracy-runtime trade-off in differentiable NAS by treating the Squeeze-and-Excitation path as a fully searchable operation with our novel single-path encoding. Our method has an overall cost of only 8 epochs (24 TPU-hours), which is up to 5,000x faster compared to prior work. Moreover, we study how different NAS formulation choices affect the performance of the designed ConvNets. Furthermore, we exploit the efficiency of our method to answer an interesting question: instead of empirically tuning the hyperparameters of the NAS solver (as in prior work), can we automatically find the hyperparameter values that yield the desired accuracy-runtime trade-off? We open-source our entire codebase at: https://github.com/dstamoulis/single-path-nas.

연구 동기 및 목표

  • 모바일 지연 시간 제약 조건 하에서 수일이 걸리던 신경망 아키텍처 검색(NAS)의 검색 비용을 3시간 이내로 극도로 줄이는 것.
  • Squeeze-and-Excitation 경로를 완전히 검색 가능한 연산으로 간주함으로써, 미분 가능 NAS에서 정확도-실행 시간 트레이드오프를 향상시키는 것.
  • 수동 또는 경험적 튜닝에 의존하지 않고, 원하는 정확도-실행 시간 트레이드오프를 달성하기 위해 NAS 하이퍼파ram터를 자동으로 튜닝할 수 있는지 탐색하는 것.
  • 클라우드 및 모바일 환경에서의 NAS 기반 AutoML 서비스를 위한 확장 가능하고 효율적인 프레임워크를 제공하는 것.

제안 방법

  • 모든 후보 연산을 각 레이어당 단일 공유 슈퍼 커널에 인코딩하고, 다중 병렬 경로 대신 커널 가중치의 부분집합 선택을 사용함으로써, 새로운 단일 경로 기반의 미분 가능 NAS 공식을 제안한다.
  • 단일 경로 슈퍼 커널에 Squeeze-and-Excitation(SE) 경로를 통합함으로써, 주어진 경로를 완전히 검색 가능한 것으로 만들고, 주의 메커니즘의 엔드 투 엔드 미분 가능 최적화를 가능하게 한다.
  • 다중 경로 슈퍼넷 훈련의 메모리 및 계산 오버헤드를 피함으로써, 총 8 에포크(24 TPU 시간)로 검색 비용을 극도로 줄인다.
  • NAS 솔버 하이퍼파ram터(예: 트레이드오프 가중치 λ)를 최적화할 수 있는 하이퍼파ram터 최적화 프레임워크를 도입한다.
  • 베이지안 최적화, 다중 신뢰도 최적화, 무작위 샘플링을 사용하여, 목표 지연 시간 80ms 근처에서 파레토 최적 모델을 도출할 수 있는 하이퍼파ram터를 자동으로 식별한다.
  • 클라우드 TPU 통합을 통해 NAS 파이프라인을 자동화하고, 여러 실행에서 스케일링 가능하고 병렬적이며 효율적인 하이퍼파라미터 검색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1모바일 지연 시간 제약 조건 하에서, 기존의 며칠이 걸리는 NAS 검색 비용을 3시간 이내로 줄일 수 있을까? 이와 동시에 정확도를 유지하거나 향상시킬 수 있을까?
  • RQ2Squeeze-and-Excitation 경로를 완전히 검색 가능한 연산으로 간주할 경우, 미분 가능 NAS에서 정확도-실행 시간 트레이드오프는 어떻게 향상되는가?
  • RQ3미분 가능 NAS 솔버의 하이퍼파라미터를 수동 또는 경험적 튜닝이 아닌 자동으로 튜닝하여 원하는 정확도-실행 시간 트레이드오프를 달성할 수 있을까?
  • RQ4하이퍼파라미터 최적화에서 저신뢰도 함수 평가가 NAS의 검색 공간을 대표하는 데 효과적인가, 아니면 최적화 수렴이 열악한 결과를 초래하는가?

주요 결과

  • Single-Path NAS는 Pixel 1 기기에서 약 80ms의 지연 시간 내에 75.62%의 상위-1 ImageNet 정확도를 달성하여, 기존의 모바일 NAS 방법과 수작업 설계된 모델(MobileNetV3 등)을 뛰어넘는 최고 성능을 기록한다.
  • 총 검색 비용을 단 8 에포크(24 TPU 시간)로 줄여, 이는 이전의 NAS 방법이 수백 개의 GPU 시간이 소요되는 것과 비교해 5,000배 빠른 성능 향상이다.
  • 저신뢰도 평가가 전체 目적 함수의 경관을 신뢰성 있게 반영하지 못함에 따라, 순수 베이지안 최적화가 다중 신뢰도 베이지안 최적화보다 성능이 뛰어나다.
  • 단일 경로 슈퍼 커널의 사용은 다중 경로 유지가 불필요해지며, 이는 메모리 및 계산 오버헤드를 감소시키고 성능을 유지하거나 향상시킨다.
  • 무작위 샘플링이 하이퍼파라미터 최적화에서 상대적으로 뛰어난 성능을 보이며, 효율적인 검색 파이프라인과 결합할 경우 단순 샘플링 방법이 NAS 하이퍼파라미터 검색에 효과적일 수 있음을 시사한다.
  • 연구 결과, 하이퍼파라미터 최적화에서 조기에 수행되는 저비용 평가가 파레토 최적 영역을 넘어선 '과도한 탐색(overshooting)'을 유도할 수 있음을 밝혀내어, Hyperband과 같은 근사 기반 방법의 위험성을 경고한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.