[논문 리뷰] Stronger NAS with Weaker Predictors
이 논문은 샘플 효율성을 향상시키기 위해 단일 강력한 예측기 대신 점차 개선되는 약한 예측기의 시퀀스를 사용하는 새로운 신경망 아키텍처 탐색(NAS) 프레임워크인 WeakNAS를 제안한다. 이전 예측기를 기반으로 점점 더 유망한 부분공간에서 아키텍처를 반복적으로 샘플링함으로써 WeakNAS는 기존 방법보다 최소 7.5배 적은 샘플 수로 상태최저성(SOTA) 성능을 달성한다. NAS-Bench-101에서 전역 최적 아키텍처를 찾는 데 있어 기존 방법보다 최소 7.5배 적은 샘플을 요구하며, MobileNet 검색 공간을 사용해 ImageNet에서 81.3%의 top-1 정확도를 달성한다.
Neural Architecture Search (NAS) often trains and evaluates a large number of architectures. Recent predictor-based NAS approaches attempt to alleviate such heavy computation costs with two key steps: sampling some architecture-performance pairs and fitting a proxy accuracy predictor. Given limited samples, these predictors, however, are far from accurate to locate top architectures due to the difficulty of fitting the huge search space. This paper reflects on a simple yet crucial question: if our final goal is to find the best architecture, do we really need to model the whole space well?. We propose a paradigm shift from fitting the whole architecture space using one strong predictor, to progressively fitting a search path towards the high-performance sub-space through a set of weaker predictors. As a key property of the weak predictors, their probabilities of sampling better architectures keep increasing. Hence we only sample a few well-performed architectures guided by the previously learned predictor and estimate a new better weak predictor. This embarrassingly easy framework, dubbed WeakNAS, produces coarse-to-fine iteration to gradually refine the ranking of sampling space. Extensive experiments demonstrate that WeakNAS costs fewer samples to find top-performance architectures on NAS-Bench-101 and NAS-Bench-201. Compared to state-of-the-art (SOTA) predictor-based NAS methods, WeakNAS outperforms all with notable margins, e.g., requiring at least 7.5x less samples to find global optimal on NAS-Bench-101. WeakNAS can also absorb their ideas to boost performance more. Further, WeakNAS strikes the new SOTA result of 81.3% in the ImageNet MobileNet Search Space. The code is available at https://github.com/VITA-Group/WeakNAS.
연구 동기 및 목표
- 제한된 샘플 수로 전체 복잡한 아키텍처 공간을 모델링하는 데 단일 강력한 예측기를 사용하는 기존 예측기 기반 NAS 방법의 비효율성을 해결하기 위해.
- 전역 모델링에서 점진적 개선을 통해 약한 예측기를 사용함으로써 계산 비용과 분산을 줄이기 위해.
- 다양한 아키텍처 표현 및 예측기 아키텍처 간의 샘플 효율성과 강건성 향상을 위해.
- 표준 NAS 벤치마크 및 실세계 검색 공간인 ImageNet에서 최고의 성능을 달성하기 위해.
제안 방법
- WeakNAS는 각 반복 단계에서 작은 집중된 아키텍처 서브셋에서 훈련된 약한 예측기를 사용해 높은 성능을 보이는 부분공간으로 샘플링을 이끌어내는 반복적 프레임워크를 채택한다.
- 각 단계에서 현재 약한 예측기의 상위-N 순위에 따라 아키텍처를 샘플링하며, 점차 검색 공간을 축소하여 고품질 영역에 집중한다.
- 탐색과 이용의 균형을 확보하기 위해 샘플링 비율 ε = M/N를 동적으로 조정하며, 각 반복에서 더 높은 성능을 보이는 아키텍처에 더 높은 샘플링 확률을 부여한다.
- 각 새로운 약한 예측기는 이전 반복에서 확보한 최신 고품질 샘플들 전용으로 훈련되며, 이로써 검색 경로의 점진적 개선이 가능해진다.
- 프레임워크는 아키텍처 인코딩과 예측기 유형에 관계없이 적용 가능하므로, 다양한 임베딩과 모델 조합(예: MLP, 랜덤 포레스트, 기울기 부스팅)을 지원한다.
- WeakNAS는 훈련 중 가짜 레이블을 활용하는 Semi-NAS와 같은 다른 방법들과 결합 가능하여 성능 향상을 더욱 높일 수 있다.
실험 결과
연구 질문
- RQ1점차적으로 검색 공간을 개선하는 약한 예측기의 시퀀스가 단일 강력한 예측기보다 샘플 효율성 측면에서 뛰어나게 되는가?
- RQ2높은 성능을 보이는 부분공간으로의 점진적 개선이 NAS에서 분산을 줄이고 강건성을 향상시키는가?
- RQ3특정 아키텍처 설계 없이도 다양한 아키텍처 인코딩과 예측기 아키텍처 간에 일반화 가능한가?
- RQ4표준 NAS 벤치마크에서 최적 아키텍처를 찾는 데 필요한 쿼리 수를 얼마나 줄일 수 있는가?
- RQ5ImageNet과 같은 대규모 검색 공간에서 최소한의 쿼리 예산으로도 WeakNAS가 최고의 성능을 달성할 수 있는가?
주요 결과
- WeakNAS는 NAS-Bench-101에서 기존 SOTA 방법보다 최소 7.5배 적은 쿼리 수로 전역 최적 아키텍처를 찾는 데 성공하여 최고의 성능을 달성했다.
- NAS-Bench-201에서 WeakNAS는 특히 낮은 샘플 예산 조건에서 강력한 예측기 기반 베이스라인 대비 상당히 낮은 분산과 더 빠른 수렴 속도를 보였다.
- ImageNet MobileNet 검색 공간에서 WeakNAS는 단지 1,000개의 쿼리로 81.3%의 top-1 정확도를 달성했으며, 유사한 쿼리 제약 조건에서 기존 방법인 LaNAS(80.8%)와 OFA(80.0%)를 모두 앞서는 성능을 보였다.
- Semi-NAS와 결합했을 때 WeakNAS는 성능 향상을 더욱 높였으며, 기존의 반감지 학습 기반 NAS 기법과의 호환성과 상호보완성을 입증했다.
- NAS에 필요한 GPU 일수를 수백 일에서 0.2일 이하로 줄여 계산 및 에너지 비용을 크게 낮췄다.
- 다양한 아키텍처 인코딩과 예측기 유형 간에도 높은 일반성과 유연성을 보이며 강력한 성능 유지를 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.