Skip to main content
QUICK REVIEW

[논문 리뷰] Few-shot Neural Architecture Search

Yiyang Zhao, Linnan Wang|arXiv (Cornell University)|2020. 06. 11.
Advanced Neural Network Applications참고 문헌 59인용 수 9
한 줄 요약

이 논문은 한 개의 슈퍼넷을 사용하는 원샷 NAS에서 발생하는 연산 요소 간의 상호적응 문제를 줄이고 성능 예측 정확도를 향상시키기 위해 다수의 서브슈퍼넷을 사용하는 소수의 신경망 아키텍처 탐색(NAS)을 제안한다. 이는 평가 비용을 낮춘 채로도 최신 기준(SOTA) 성능을 달성하며, 단지 7개의 서브슈퍼넷만으로도 600 MFLOPS에서 ImageNet에서 80.5%의 top-1 정확도를 기록한다.

ABSTRACT

Efficient evaluation of a network architecture drawn from a large search space remains a key challenge in Neural Architecture Search (NAS). Vanilla NAS evaluates each architecture by training from scratch, which gives the true performance but is extremely time-consuming. Recently, one-shot NAS substantially reduces the computation cost by training only one supernetwork, a.k.a. supernet, to approximate the performance of every architecture in the search space via weight-sharing. However, the performance estimation can be very inaccurate due to the co-adaption among operations. In this paper, we propose few-shot NAS that uses multiple supernetworks, called sub-supernet, each covering different regions of the search space to alleviate the undesired co-adaption. Compared to one-shot NAS, few-shot NAS improves the accuracy of architecture evaluation with a small increase of evaluation cost. With only up to 7 sub-supernets, few-shot NAS establishes new SoTAs: on ImageNet, it finds models that reach 80.5% top-1 accuracy at 600 MB FLOPS and 77.5% top-1 accuracy at 238 MFLOPS; on CIFAR10, it reaches 98.72% top-1 accuracy without using extra data or transfer learning. In Auto-GAN, few-shot NAS outperforms the previously published results by up to 20%. Extensive experiments show that few-shot NAS significantly improves various one-shot methods, including 4 gradient-based and 6 search-based methods on 3 different tasks in NasBench-201 and NasBench1-shot-1.

연구 동기 및 목표

  • 단일 슈퍼넷 내에서 발생하는 연산 요소 간의 상호적응으로 인해 발생하는 원샷 NAS의 성능 예측 정확도 저하 문제를 해결한다.
  • 각 아키텍처를 다시 학습해야 하는 전형적인 NAS의 계산 비용을 감소시킨다.
  • 슈퍼넷이 예측한 성능과 실제 아키텍처 성능 간의 상관관계를 향상시켜 탐색의 효율성과 정확도를 높인다.
  • 기울기 기반 및 검색 기반 NAS 방법과 모두 통합 가능한 확장성 있고 일반화 능력이 뛰어난 프레임워크를 개발한다.
  • 추가 데이터나 사전학습 없이도 다양한 벤치마크, 즉 ImageNet, CIFAR-10, Auto-GAN에서 뚜렷한 성능 향상을 입증한다.

제안 방법

  • 복합 엣지 기반의 재귀적 분할을 통해 전체 아키텍처 탐색 공간을 상호배타적인 하위 영역으로 나눈다.
  • 각 파티션에 대해 별도의 서브슈퍼넷을 학습시어 국소적인 아키텍처 성능를 낮은 상호적응으로 모델링한다.
  • 전이 학습의 계층적 사슬: 공유된 루트 슈퍼넷에서 서브슈퍼넷을 초기화하고 개별적으로 미세조정한다.
  • 서브슈퍼넷 간의 가중치 공유를 적용하여, 해당하는 서브슈퍼넷을 선택하고 불필요한 연산을 마스킹함으로써 어떤 아키텍처도 빠르게 평가할 수 있도록 한다.
  • 계층적 파티션을 유지함으로써 모델 용량을 확보하고 다양한 아키텍처 유형 간 간섭을 줄인다.
  • 기존 NAS 파이프라인에 소수의 평가자 기능을 통합하여 기울기 기반 및 검색 기반 최적화 전략을 모두 지원한다.

실험 결과

연구 질문

  • RQ1단일 슈퍼넷 대비 다수의 서브슈퍼넷이 상호적응을 줄이고 성능 예측 정확도를 향상시키는가?
  • RQ2성능 예측 정확도 향상에 기여하면서도 비용 증가를 최소화하기 위해 필요한 서브슈퍼넷의 최소 수는 얼마인가?
  • RQ3소수의 NAS는 다양한 벤치마크와 작업에서 기존의 원샷 NAS 방법의 성능을 향상시키는가?
  • RQ4추가 데이터나 사전학습 없이도 소수의 NAS가 ImageNet 및 CIFAR-10과 같은 표준 벤치마크에서 최신 기준 NAS 방법을 초월하는가?
  • RQ5경로 드롭아웃이나 각도 기반 정규화와 같은 다른 슈퍼넷 개선 기법과 비교해 소수의 NAS는 어떻게 성능을 내는가?

주요 결과

  • 소수의 NAS는 단지 7개의 서브슈퍼넷만으로 600 MFLOPS에서 ImageNet에서 80.5%의 top-1 정확도를 달성하여 효율적인 모델의 새로운 최신 기준(SOTA)을 수립한다.
  • CIFAR-10에서 소수의 NAS는 추가 데이터나 ImageNet 사전학습 없이도 98.72%의 top-1 정확도를 기록하며 이전 방법들을 능가한다.
  • Auto-GAN에서 소수의 NAS는 FID 점수를 12.42에서 10.73으로 향상시켜 원래의 원샷 방법 대비 약 20%의 상대적 향상을 보였다.
  • 다음 5개의 서브슈퍼넷만으로도 소수의 NAS는 NasBench-201과 NasBench1-shot-1에서 기울기 기반 4개 및 검색 기반 6개의 NAS 방법을 크게 향상시켰다.
  • 소수의 NAS는 예측된 성능과 실제 성능 간 페어슨 상관계수를 원샷 NAS 대비 최대 0.15 향상시켜 순위 유지 능력이 향상됨을 시사한다.
  • Penn Treebank에서 소수의 NAS는 탐색 비용을 1.56 GPU 일로 줄여 테스트 퍼플렉서티 54.89를 달성했으며, 이는 DARTs의 55.7보다 뛰어나고 시간은 절반 이하로 줄인 결과이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.