[논문 리뷰] AttentiveNAS: Improving Neural Architecture Search via Attentive Sampling
AttentiveNAS는 신경망 아키텍처 탐색을 향상시키기 위해 정확도-FLOPs 파레토 프론트를 향상시킬 가능성이 높은 네트워크에 중점을 두는 주의적 샘플링 전략인 BestUp과 WorstUp을 도입함으로써, 단지 491 MFLOPs로 80.7%의 ImageNet top-1 정확도를 달성하여 MobileNetV3 및 FBNetV3와 같은 모델을 능가함.
Neural architecture search (NAS) has shown great promise in designing state-of-the-art (SOTA) models that are both accurate and efficient. Recently, two-stage NAS, e.g. BigNAS, decouples the model training and searching process and achieves remarkable search efficiency and accuracy. Two-stage NAS requires sampling from the search space during training, which directly impacts the accuracy of the final searched models. While uniform sampling has been widely used for its simplicity, it is agnostic of the model performance Pareto front, which is the main focus in the search process, and thus, misses opportunities to further improve the model accuracy. In this work, we propose AttentiveNAS that focuses on improving the sampling strategy to achieve better performance Pareto. We also propose algorithms to efficiently and effectively identify the networks on the Pareto during training. Without extra re-training or post-processing, we can simultaneously obtain a large number of networks across a wide range of FLOPs. Our discovered model family, AttentiveNAS models, achieves top-1 accuracy from 77.3% to 80.7% on ImageNet, and outperforms SOTA models, including BigNAS and Once-for-All networks. We also achieve ImageNet accuracy of 80.1% with only 491 MFLOPs. Our training code and pretrained models are available at https://github.com/facebookresearch/AttentiveNAS.
연구 동기 및 목표
- 모든 후보 네트워크를 동일하게 취급하는 두 단계 NAS에서 균일 샘플링의 비효율성을 해결함. 이는 파레토 개선 잠재력이 상이한 네트워크에도 동일하게 대응하기 때문임.
- 훈련 중 현재 최고 또는 최악의 파레토 프론트에 있는 네트워크를 전략적으로 샘플링하여 성능 파레토 프론트를 향상시키기.
- 훈련 손실과 정확도 예측기와 같은 효율적인 방법을 사용하여 최고 또는 최악의 파레토 프론트에 있는 네트워크를 식별하고 우선순위를 정하는 저비용 방법 개발.
- 재훈련이나 후처리 없이도 뛰어난 정확도-FLOPs 트레이드오프를 달성함으로써 다양한 성능을 내는 모델의 가족을 생성함.
제안 방법
- BestUp(현재 최고의 파레토 프론트 향상에 집중)과 WorstUp(가장 열악한 성능을 보이는 모델 향상에 집중)이라는 두 가지 주의적 샘플링 전략을 제안함.
- 훈련 중 최고 또는 최악의 파레토 프론트에 있는 네트워크를 효율적으로 식별하기 위해 훈련 손실과 사전 학습된 정확도 예측기를 프록시로 사용함.
- 두 단계 NAS의 가중치 공유 훈련 단계에 주의적 샘플링을 통합하여 계산 효율성을 유지하면서도 모델 품질을 향상시킴.
- 최종 가중치 공유 모델에 대해 유전적 탐색을 적용하여 다양한 FLOPs 범위에서 높은 성능을 내는 아키텍처를 발견함.
- 203 MFLOPs에서 709 MFLOPs에 이르는 범위를 아우르는 모든 모델가 하나의 통합 훈련 프로세스를 통해 생성함.
- 훈련 후 원래의 ImageNet 검증 세트를 사용하여 성능을 평가함으로써 이전 방법들과의 공정한 비교를 확보함.
![Figure 1: Comparison of AttentiveNAS with prior NAS approaches [ 36 , 10 , 43 , 3 , 35 ] on ImageNet.](https://ar5iv.labs.arxiv.org/html/2011.09011/assets/x1.png)
실험 결과
연구 질문
- RQ1최고 또는 최악의 파레토 프론트에 집중하는 주의적 샘플링 전략이 균일 샘플링에 비해 최종 검색된 모델의 정확도를 향상시키는가?
- RQ2훈련 중 최악의 파레토 모델 성능을 향상시키는 것이 전체 파레토 프론트 성능을 향상시키는가?
- RQ3주로 훈련 손실과 예측된 정확도를 비교할 때, 효과적인 주의적 샘플링을 이끄는 데 어떤 프록시 신호가 더 유리한가?
- RQ4추가적인 재훈련이나 후처리 없이 주의적 샘플링이 최신 기술 수준의 정확도-FLOPs 트레이드오프를 달성할 수 있는가?
- RQ5NAS 샘플링 전략에서 탐색과 이용의 최적의 균형은 무엇인가?
주요 결과
- WorstUp-1M (acc)는 200±10 MFLOPs 범위에서 균일 샘플링보다 0.3% 높은 top-1 정확도를 기록하여, 최악의 성능을 보이는 모델을 향상시키는 것이 전체 파레토 프론트를 향상시킬 수 있음을 보여줌.
- WorstUp-50 (acc)와 WorstUp-1M (acc)는 파레토 프론트의 하한선을 크게 향상시켜, 균일 샘플링 및 BestUp 전략보다 높은 최소 정확도와 1분위 정확도를 확보함.
- BestUp-3 (loss)는 탐색과 이용을 효과적으로 균형 잡은 바탕으로 전체 성능이 가장 뛰어나, 균일 샘플링 및 다른 BestUp 변종보다 뛰어남.
- AttentiveNAS-A5는 단지 491 MFLOPs로 ImageNet에서 80.1%의 top-1 정확도를 달성하여, 유사한 FLOPs 제약 조건에서 MobileNetV3 및 FBNetV3를 능가함.
- AttentiveNAS-A6는 709 MFLOPs에서 80.7%의 top-1 정확도를 기록하여 700+ MFLOPs 범위의 모델 중 최신 기술 수준을 수립함.
- 이 방법은 모든 FLOPs 범위에서 최신 기술 수준의 정확도를 달성하여, BigNAS, OFA, EfficientNet 및 FBNetV3와 같은 기존 기준 모델들을 모두 능가함.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.